CL9 IA – CL9 Tecnologias

CL9 Tecnologias

InteligĂȘncia Artificial · InferĂȘncia privada no Brasil

Seus prompts
nĂŁo saem
do Brasil

LLMs abertos rodando na infraestrutura da CL9, em GPU dedicada, aqui no Brasil. VocĂȘ contrata vazĂŁo, nĂŁo conta token por token e paga o mesmo valor todo mĂȘs. Endpoint compatĂ­vel com OpenAI®: troca a URL e a chave, o resto do cĂłdigo continua igual.

TrĂȘs coisas que
uma API estrangeira
nĂŁo entrega

Quanta vazĂŁo vocĂȘ precisa?

InformaçÔes Gerais da Plataforma

O que Ă© TPM: É o teto de tokens por minuto, funcionando como a velocidade de um link de internet.

Franquia Mensal: NĂŁo hĂĄ franquia mensal fixa; dentro do teto estipulado, o uso Ă© ilimitado.

Tokens por Minuto
(TPM) Estimado

60.000 TPM

Uso Indicado

Chatbot interno, ~30 pessoas

CaracterĂ­stica e comportamento da demanda.

Consultas curtas e esparsas ao longo do dia. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.

Tokens por Minuto
(TPM) Estimado

150.000 TPM

Uso Indicado

Assistente com RAG, ~100 usuĂĄrios

CaracterĂ­stica e comportamento da demanda.

Prompts grandes por causa do contexto recuperado. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.

Tokens por Minuto
(TPM) Estimado

350.000 TPM

Uso Indicado

Agente com vĂĄrias etapas

CaracterĂ­stica e comportamento da demanda.

Cada tarefa dispara uma sequĂȘncia de chamadas. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.

Tokens por Minuto
(TPM) Estimado

700.000 TPM

Uso Indicado

Extração em lote (documentos)

CaracterĂ­stica e comportamento da demanda.

Volume concentrado em poucas janelas do dia. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.

Uso Indicado

Plataforma com 400+ usuĂĄrios

CaracterĂ­stica e comportamento da demanda.

VĂĄrios times usando ao mesmo tempo, com picos. TPM Ă© o teto de tokens por minuto, como a velocidade de um link de internet. NĂŁo hĂĄ franquia mensal: dentro do teto, vocĂȘ usa o quanto quiser.

*GrĂĄficos mostrados em cada plano sĂŁo meramente ilustrativos.

Escolha pela vazĂŁo, nĂŁo pelo consumo.

Sem cobrança por token e sem surpresa no fim do mĂȘs. O que muda entre os planos Ă© o teto de tokens por minuto (TPM), o nĂșmero de chaves de API e o acesso ao modo thinking.

Preço fixo mensal, faturado em Reais.

Starter

60.000 TPM

AutomaçÔes pontuais
e chatbots internos.

R$ 495 /mĂȘs

Pro

150.000 TPM

Assistentes com RAG
e agentes em produção.

R$ 1.309 /mĂȘs

Business

350.000 TPM

VĂĄrios times ou produto
com base de usuĂĄrios.

R$ 2.519 /mĂȘs

Enterprise

700.000 TPM

Alta volumetria
e cargas em lote.

R$ 3.520 /mĂȘs

Troca de plano a qualquer momento
Subiu o consumo? O teto muda na hora, sem reinstalar nada.
Chaves de API por plano
O teto de TPM Ă© aplicado na assinatura. As chaves permitem separar ambientes ou produtos, de 1 no Starter a 30 no Enterprise.
Precisa de mais que 700.000 TPM? Montamos capacidade reservada em GPU dedicada. Veja abaixo

Se o seu cĂłdigo jĂĄ fala com a OpenAI ®, ele jĂĄ fala com a gente.

Sem cobrança por token e sem surpresa no fim do mĂȘs.
O que muda entre os planos Ă© o teto de tokens por minuto (TPM),
o nĂșmero de chaves de API e o acesso ao modo thinking.
Preço fixo mensal, faturado em Reais.

GPU dedicada

Placas GPU inteiras, reservadas exclusivamente para sua operação. Execute inferĂȘncia, fine-tuning e modelos prĂłprios com alto desempenho, recursos dedicados e total isolamento na infraestrutura CL9.
Capacidade exclusiva

Capacidade dedicada sob medida

VocĂȘ nos informa o que pretende rodar, se jĂĄ tem uma ideia da GPU desejada e quais sĂŁo suas necessidades. Com base nisso, elaboramos uma proposta sob medida para a sua operação.

Isolamento fĂ­sico

fine-tuning

modelos prĂłprios

SLA dedicado

IA na CL9 x sĂł em provedores terceiros

IA prĂłpria na CL9

SĂł em provedores terceiros

Ficou com dĂșvidas?

Desde o que é o TPM até a privacidade dos seus dados: veja as perguntas mais frequentes antes de assinar.

TPM Ă© o teto de tokens por minuto, os de entrada e os de saĂ­da somados. Se vocĂȘ enviar um prompt de 4.000 tokens e receber 500 de resposta, foram 4.500 tokens naquele minuto. O contador zera a cada minuto e nĂŁo existe cota mensal: dentro do teto, use o quanto quiser.

As requisiçÔes acima do limite recebem o cĂłdigo 429 e podem ser repetidas no minuto seguinte, o comportamento padrĂŁo dos SDKs jĂĄ trata isso. Nada Ă© cobrado a mais e nenhuma chamada Ă© perdida em silĂȘncio. Se acontecer com frequĂȘncia, o painel mostra e vocĂȘ troca de plano.
NĂŁo. VocĂȘ escolhe pela vazĂŁo (TPM), nĂŁo por um volume mensal de tokens. O preço Ă© fixo por mĂȘs e nĂŁo depende de quanto vocĂȘ usou no dia — sĂł do teto de tokens por minuto que a sua carga precisa.
Modelos abertos de alto desempenho: Gemma 4, disponĂ­vel em todos os planos, e Gemma 4 + thinking, com raciocĂ­nio estendido, a partir do plano Pro. Na GPU dedicada, vocĂȘ pode rodar o modelo que preferir.
Porque Ă© de peso aberto, com licença permissiva: podemos hospedar, auditar e fixar a versĂŁo que vocĂȘ validou. Um modelo fechado sĂł existe como serviço de terceiro, o que anula a soberania que vocĂȘ estĂĄ contratando.
Sim, ficam no Brasil, e nĂŁo. Toda a inferĂȘncia acontece na infraestrutura da CL9 em territĂłrio nacional. Seus dados nunca sĂŁo usados para treinar modelos, nossos ou de terceiros e nĂŁo saem do seu ambiente. Diferente dos grandes provedores internacionais, onde jĂĄ houve vazamento comprovado de informaçÔes privadas.
Sim. Como o tratamento ocorre inteiramente no Brasil, vocĂȘ evita a transferĂȘncia internacional de dados pessoais, um dos pontos mais sensĂ­veis da LGPD quando se usa IA hospedada no exterior. Isso simplifica a sua base legal e mantĂ©m os dados sob a sua governança.
NĂŁo. O endpoint Ă© compatĂ­vel com OpenAI: mesmos SDKs, streaming e chamada de função. Na prĂĄtica, vocĂȘ troca a URL base e a chave — o resto do cĂłdigo continua igual — e pode rodar em paralelo com o provedor atual durante o teste.
Cada assinatura tem uma chave, e Ă© nela que o teto de TPM Ă© aplicado, Ă© o que garante a vazĂŁo contratada. Para isolar ambientes ou produtos, contrate uma assinatura para cada: assim um nunca consome a vazĂŁo do outro. Se o objetivo Ă© sĂł medir consumo por ĂĄrea ou usuĂĄrio, o painel jĂĄ mostra sem chave separada.
A qualquer momento. Subiu o consumo? O teto de TPM muda na hora, sem reinstalar nada. VocĂȘ começa pequeno e cresce no seu ritmo.
Montamos capacidade reservada em GPU dedicada, dimensionada para a sua carga, com isolamento físico e a opção de fine-tuning e modelos próprios. Fale com o nosso time.
Sim. Liberamos uma chave de avaliação por tempo determinado no plano que vocĂȘ estĂĄ considerando, para medir latĂȘncia e qualidade com o seu prĂłprio caso de uso, nĂŁo com benchmark de folheto.
Tudo em Reais, mensal e fixo por plano, sem oscilação cambial nem reajuste unilateral, na mesma relação comercial que vocĂȘ jĂĄ tem com a CL9. A GPU dedicada Ă© faturada por GPU/mĂȘs.
Sim. O mesmo time que cuida da sua infraestrutura na CL9 hoje, com o atendimento direto e humano de sempre, agora também para a sua jornada em IA.
VENONE | agencia de design