InteligĂȘncia Artificial · InferĂȘncia privada no Brasil
Seus prompts
nĂŁo saem
do Brasil
LLMs abertos rodando na infraestrutura da CL9, em GPU dedicada, aqui no Brasil. VocĂȘ contrata vazĂŁo, nĂŁo conta token por token e paga o mesmo valor todo mĂȘs. Endpoint compatĂvel com OpenAI®: troca a URL e a chave, o resto do cĂłdigo continua igual.
- Por que rodar na CL9
TrĂȘs coisas que
uma API estrangeira
nĂŁo entrega
A requisição não cruza o oceano.
A inferĂȘncia acontece na mesma infraestrutura que jĂĄ atende os seus servidores. Para agentes que fazem vĂĄrias chamadas em sequĂȘncia, o tempo economizado em cada salto se acumula na resposta final.
Dado tratado em
territĂłrio nacional.
#soberania_brasil
Nada do que vocĂȘ
envia treina modelo.
#privacidade_dados
- Dimensione
Quanta vazĂŁo vocĂȘ precisa?
InformaçÔes Gerais da Plataforma
O que Ă© TPM: Ă o teto de tokens por minuto, funcionando como a velocidade de um link de internet.
Franquia Mensal: NĂŁo hĂĄ franquia mensal fixa; dentro do teto estipulado, o uso Ă© ilimitado.
Tokens por Minuto
(TPM) Estimado
60.000 TPM
Uso Indicado
Chatbot interno, ~30 pessoas
CaracterĂstica e comportamento da demanda.
Tokens por Minuto
(TPM) Estimado
150.000 TPM
Uso Indicado
Assistente com RAG, ~100 usuĂĄrios
CaracterĂstica e comportamento da demanda.
Tokens por Minuto
(TPM) Estimado
350.000 TPM
Uso Indicado
Agente com vĂĄrias etapas
CaracterĂstica e comportamento da demanda.
Tokens por Minuto
(TPM) Estimado
700.000 TPM
Uso Indicado
Extração em lote (documentos)
CaracterĂstica e comportamento da demanda.
Uso Indicado
Plataforma com 400+ usuĂĄrios
CaracterĂstica e comportamento da demanda.
VĂĄrios times usando ao mesmo tempo, com picos. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.
*GrĂĄficos mostrados em cada plano sĂŁo meramente ilustrativos.
- Planos por vazĂŁo
Escolha pela vazĂŁo, nĂŁo pelo consumo.
Sem cobrança por token e sem surpresa no fim do mĂȘs. O que muda entre os planos Ă© o teto de tokens por minuto (TPM), o nĂșmero de chaves de API e o acesso ao modo thinking.
Preço fixo mensal, faturado em Reais.
Starter
60.000 TPM
e chatbots internos.
R$ 495 /mĂȘs
- 1 chave de API
- Gemma 4 ? (Base): Refere-se Ă versĂŁo padrĂŁo de inferĂȘncia sem o modo de raciocĂnio passo a passo forçado. Dependendo do perfil configurado no seu servidor local (como Ollama, vLLM ou LM Studio), ele aponta para o modelo denso de 30,7 bilhĂ”es de parĂąmetros (31B Dense) ou para a versĂŁo intermediĂĄria de 11,95 bilhĂ”es (12B Unified).
- Capacidade: 60.000 tokens/min e 60 requisiçÔes/min
- Indicado para até 4 usuårios simultùneos ou 1 integração
- API compatĂvel com OpenAI ® âą streaming e function calling
- Métricas de consumo no painel
- Dados processados no Brasil e nunca utilizados para treinar modelos
Pro
150.000 TPM
e agentes em produção.
R$ 1.309 /mĂȘs
- Gemma 4 ? (Base): Refere-se Ă versĂŁo padrĂŁo de inferĂȘncia sem o modo de raciocĂnio passo a passo forçado. Dependendo do perfil configurado no seu servidor local (como Ollama, vLLM ou LM Studio), ele aponta para o modelo denso de 30,7 bilhĂ”es de parĂąmetros (31B Dense) ou para a versĂŁo intermediĂĄria de 11,95 bilhĂ”es (12B Unified).
- Gemma 4 + Think ? Gemma4 + Think: Utiliza exatamente a mesma arquitetura de parĂąmetros subjacente (geralmente o 31B Dense com 30,7B de parĂąmetros ou o 26B A4B MoE com 25,2B totais e 3,8B ativos), mas com a flag de Chain-of-Thought (modo de pensamento) ativada por padrĂŁo no template de chat para priorizar respostas lĂłgicas e analĂticas complexas.
- Capacidade: 150.000 tokens/min e 150 requisiçÔes/min
- Indicado para até 8 usuårios simultùneos ou 2 integraçÔes de sistema
- API compatĂvel com o padrĂŁo OpenAI ® âą streaming e function calling incluĂdos
- Preço fixo mensal, sem cobrança por token
- Dados processados no Brasil e nunca utilizados para treinar modelos
Business
350.000 TPM
com base de usuĂĄrios.
R$ 2.519 /mĂȘs
- Gemma 4 ? (Base): Refere-se Ă versĂŁo padrĂŁo de inferĂȘncia sem o modo de raciocĂnio passo a passo forçado. Dependendo do perfil configurado no seu servidor local (como Ollama, vLLM ou LM Studio), ele aponta para o modelo denso de 30,7 bilhĂ”es de parĂąmetros (31B Dense) ou para a versĂŁo intermediĂĄria de 11,95 bilhĂ”es (12B Unified).
- Gemma 4 + Think ? Gemma 4 + Think: Utiliza exatamente a mesma arquitetura de parĂąmetros subjacente (geralmente o 31B Dense com 30,7B de parĂąmetros ou o 26B A4B MoE com 25,2B totais e 3,8B ativos), mas com a flag de Chain-of-Thought (modo de pensamento) ativada por padrĂŁo no template de chat para priorizar respostas lĂłgicas e analĂticas complexas.
- Capacidade: 350.000 tokens/min e 300 requisiçÔes/min
- Indicado para até 24 usuårios simultùneos ou mix de usuårios e integraçÔes
- MĂșltiplas chaves de API para separar aplicaçÔes e times
- API compatĂvel com o padrĂŁo OpenAI ® âą streaming e function calling incluĂdos
- Preço fixo mensal, sem cobrança por token
- Consumo por usuĂĄrio final no painel
- Dados processados no Brasil e nunca utilizados para treinar modelos
Enterprise
700.000 TPM
Alta volumetria
e cargas em lote.
R$ 3.520 /mĂȘs
- Gemma 4 ? (Base): Refere-se Ă versĂŁo padrĂŁo de inferĂȘncia sem o modo de raciocĂnio passo a passo forçado. Dependendo do perfil configurado no seu servidor local (como Ollama, vLLM ou LM Studio), ele aponta para o modelo denso de 30,7 bilhĂ”es de parĂąmetros (31B Dense) ou para a versĂŁo intermediĂĄria de 11,95 bilhĂ”es (12B Unified).
- Gemma 4 + Think ? Gemma 4 + Think: Utiliza exatamente a mesma arquitetura de parĂąmetros subjacente (geralmente o 31B Dense com 30,7B de parĂąmetros ou o 26B A4B MoE com 25,2B totais e 3,8B ativos), mas com a flag de Chain-of-Thought (modo de pensamento) ativada por padrĂŁo no template de chat para priorizar respostas lĂłgicas e analĂticas complexas.
- Capacidade: 700.000 tokens/min e 600 requisiçÔes/min
- Indicado para atĂ© 48 usuĂĄrios simultĂąneos, lotes de documentos e mĂșltiplas integraçÔes
- MĂșltiplas chaves de API para separar aplicaçÔes e times
- API compatĂvel com o padrĂŁo OpenAI ® âą streaming e function calling incluĂdos
- Preço fixo mensal, sem cobrança por token
- Consumo por usuĂĄrio final no painel
- Prioridade em horĂĄrio de pico
- Dados processados no Brasil e nunca utilizados para treinar modelos
Subiu o consumo? O teto muda na hora, sem reinstalar nada.
O teto de TPM Ă© aplicado na assinatura. As chaves permitem separar ambientes ou produtos, de 1 no Starter a 30 no Enterprise.
- Integração
Se o seu cĂłdigo jĂĄ fala com a OpenAI ®, ele jĂĄ fala com a gente.
Sem cobrança por token e sem surpresa no fim do mĂȘs.
O que muda entre os planos Ă© o teto de tokens por minuto (TPM),
o nĂșmero de chaves de API e o acesso ao modo thinking.
Preço fixo mensal, faturado em Reais.
- Além dos planos
GPU dedicada
Capacidade dedicada sob medida
Isolamento fĂsico
fine-tuning
modelos prĂłprios
- Por que rodar na CL9
IA na CL9 x sĂł em provedores terceiros
IA prĂłpria na CL9
- Seus dados ficam com vocĂȘ, nada sai da sua infraestrutura para treinar modelos de terceiros.
- VazĂŁo previsĂvel, preço fixo mensal por TPM, a fatura nĂŁo depende do volume do dia.
- Soberania e conformidade, seus dados ficam 100% no Brasil, sob a LGPD e sob o seu controle.
- Desempenho dedicado, sem fila nem degradação quando o provedor estå sobrecarregado.
- Integração imediata: API 100% compatĂvel com o padrĂŁo OpenAI ®, migre apontando a URL, sem reescrever cĂłdigo.
- Suporte de quem opera a infraestrutura: vocĂȘ fala com engenheiros da CL9, nĂŁo com um formulĂĄrio.
SĂł em provedores terceiros
- Dados sensĂveis trafegam e podem ser retidos fora do seu controle.
- Jå houve vazamento comprovado de informaçÔes privadas nas grandes IAs.
- Preço varia com cùmbio e reajustes unilaterais.
- Dados processados fora do Brasil dificultam a conformidade.
- LatĂȘncia e limites de uso compartilhados com o mundo inteiro.
- DependĂȘncia (lock-in) de SDKs e recursos proprietĂĄrios que dificultam a saĂda.
- Suporte impessoal em outro idioma e fuso, sem acesso a quem opera a plataforma.
- Perguntas frequentes
Ficou com dĂșvidas?
TPM Ă© o teto de tokens por minuto, os de entrada e os de saĂda somados. Se vocĂȘ enviar um prompt de 4.000 tokens e receber 500 de resposta, foram 4.500 tokens naquele minuto. O contador zera a cada minuto e nĂŁo existe cota mensal: dentro do teto, use o quanto quiser.