Índice do artigofaltam 26 min de leitura
Recomendação direta: escolha o modelo mais rápido e mais barato que ultrapassa o piso de qualidade que o seu atendimento exige. Velocidade é vantagem operacional, não substituto de naturalidade, persuasão ou aderência à voz da marca. E o piso de qualidade só você consegue medir, porque nenhum ranking público mede português comercial brasileiro.
Resumo do artigo
- Parâmetro deixou de ser especificação: OpenAI e Anthropic pararam de publicar o tamanho dos modelos, e o Kimi K2.6 ativa cerca de 32 bilhões de parâmetros por token, não 1 trilhão.
- Tokens por segundo não é o tempo que o cliente sente: até o primeiro token de resposta, o GPT-OSS-120B na Cerebras leva 1,55 s e o Gemini 3.6 Flash leva 15,67 s.
- Três mil conversas por mês custam US$ 10,20 no GPT-OSS-120B e US$ 54,00 no Gemini 3.6 Flash, uma diferença de US$ 43,80 por mês.
- A Cerebras não tem plano gratuito permanente: o Free Trial dá US$ 5 em créditos que expiram em 30 dias e exige método de pagamento verificado.
- Nenhum ranking público mede português comercial brasileiro, então o indicador que decide é o custo por conversa resolvida corretamente, medido com os seus casos.
Durante três anos, o mercado comprou inteligência artificial como quem compra carro por cilindrada: quanto maior o número, melhor.
Em 2026 esse número virou nota de rodapé. As duas empresas que lideram os rankings de raciocínio, OpenAI e Anthropic, simplesmente pararam de publicar o tamanho dos seus modelos. O que elas publicam hoje é preço por milhão de tokens, janela de contexto, níveis de esforço de raciocínio e resultados de benchmark.
Só que o pêndulo foi longe demais para o outro lado. Trocar "quantos bilhões de parâmetros" por "quantos tokens por segundo" é o mesmo erro com outra métrica. Um atendimento que responde instantaneamente e escreve mal perde o cliente do mesmo jeito.
Este artigo compara os modelos disponíveis hoje nos três eixos que realmente decidem: velocidade, custo e qualidade de escrita. E mostra por que o terceiro é o mais difícil de medir, e o mais caro de errar.
Resumo rápido para quem tem pressa
| Se o seu problema é... | Escolha inicial | Por quê |
|---|---|---|
| Classificar intenção, consultar status, atualizar CRM | GPT-OSS-120B na Cerebras | 1.851 tokens/s medidos, US$ 0,35 por milhão de entrada, pesos abertos |
| Ler print, foto de boleto ou comprovante | Gemma 4 31B na Cerebras | Aceita imagem direto, sem sair da infraestrutura rápida |
| Documento longo ou PDF complexo | Gemini 3.6 Flash | Multimodal nativo e bom em texto, mas 15,67 s até responder |
| Negociação difícil, reclamação grave, proposta | Claude Opus 5 | Topo de raciocínio, com custo que só se justifica por exceção |
| Texto de altíssimo valor, comunicação executiva | Claude Fable 5 | Primeiro lugar em escrita nos rankings públicos, e o mais lento e caro |
| Validar a ideia gastando pouco | Free Trial da Cerebras | US$ 5 em créditos que expiram em 30 dias, exige método de pagamento |
| Volume gigante com orçamento mínimo | GPT-5.6 Luna | US$ 0,20 por milhão de entrada, o mais barato da comparação |
Se quiser pular direto para os números, vá para a conta do WhatsApp. Se o seu problema é escolher por qualidade, vá para a seção de qualidade de resposta.
O fim da corrida dos parâmetros
A contagem de parâmetros morreu por três motivos concretos.
Primeiro: o número virou marketing. O Kimi K2.6, da Moonshot AI, tem 1 trilhão de parâmetros no papel. Só que ele usa uma arquitetura chamada Mixture-of-Experts, ou mistura de especialistas: em vez de acionar o modelo inteiro a cada palavra, um roteador escolhe apenas algumas sub-redes especializadas por token. Na prática, o Kimi K2.6 ativa cerca de 32 bilhões de parâmetros por token, não 1 trilhão. O GPT-OSS-120B tem 117 bilhões totais e ativa 5,1 bilhões. Dizer "modelo trilionário" descreve o tamanho do arquivo no disco, não a capacidade que roda a cada palavra.
Segundo: os líderes não contam mais. Ninguém fora da Anthropic sabe quantos parâmetros tem o Claude Opus 5. Ninguém fora da OpenAI sabe o tamanho do GPT-5.6 Sol. Circulam estimativas em fóruns técnicos, mas nenhuma é confirmada e nenhuma deveria entrar numa decisão de arquitetura.
Terceiro: modelos pequenos alcançaram os grandes em capacidade bruta. O Gemma 4 31B, do Google DeepMind, é um modelo denso de 30,7 bilhões de parâmetros com licença Apache 2.0, e disputa de igual para igual com modelos proprietários de entrada.
A conclusão prática é desconfortável: parâmetro deixou de ser especificação e virou taxa de compressão. A pergunta certa passou a ser "quantos tokens por segundo, a que custo, com que qualidade?".
E é na terceira parte dessa pergunta que quase todo mundo escorrega.
Velocidade: o que os números realmente dizem
Existe um erro de avaliação que se repete em quase todo projeto de atendimento. A equipe testa cinco modelos no playground, escolhe o que dá a melhor resposta e só descobre o problema em produção: o cliente não espera.
Só que medir isso por "tokens por segundo" engana, e engana feio.
Tokens por segundo não é o tempo que o cliente sente
Um modelo pode gerar texto muito rápido depois que começa e ainda assim demorar muito para começar. Quando o modelo raciocina antes de responder, o cliente fica olhando a tela durante todo o raciocínio.
A prova mais limpa disso é comparar o mesmo modelo consigo mesmo. O Gemini 3.5 Flash, no mesmo provedor, medido pela Artificial Analysis:
| Gemini 3.5 Flash | Tokens por segundo | Tempo até o primeiro token de resposta |
|---|---|---|
| Esforço mínimo | 168,3 | 1,05 s |
| Esforço alto | 181,1 | 16,76 s |
Repare: no esforço alto ele gera mais rápido, e mesmo assim o cliente espera dezesseis vezes mais. A variável não é a velocidade de geração, é o tempo de raciocínio antes da primeira palavra visível.
O mesmo padrão aparece no Gemini 3.5 Flash-Lite: 391,5 tokens/s, throughput muito acima da mediana da categoria, mas 8,63 segundos até o primeiro token de resposta.
E o caso mais importante para quem está escolhendo modelo agora é o Gemini 3.6 Flash, lançado em 21 de julho de 2026 e recomendado em vários comparativos recentes. Na configuração de esforço alto, a Artificial Analysis mede nele 212,7 tokens por segundo, bem acima da mediana de 72,8 t/s da categoria. E mede também 15,67 segundos até o primeiro token, contra uma mediana de 2,80 segundos entre modelos de raciocínio da mesma faixa de preço.
Ou seja: ele gera rápido e demora muito para começar. Para um relatório assíncrono, isso é irrelevante. Para alguém esperando no WhatsApp, é a diferença entre uma conversa e um abandono.
Onde a Cerebras realmente está
Aqui preciso corrigir um número que circula muito, inclusive em uma versão anterior deste artigo.
A Cerebras publica cerca de 3.000 tokens/s para o GPT-OSS-120B, e não é só num post antigo: o número está na coluna de velocidade do catálogo de modelos e na página do próprio modelo, na documentação vigente. Só que é número da própria empresa, sem medição independente citada. A Artificial Analysis mede 1.851 tokens/s e afirma na página de provedores que nenhum provedor chega perto de 3.000 tokens/s. Os dois são reais, com origens diferentes: um é especificação declarada pelo fornecedor, o outro é medição de terceiro.
Os números medidos por terceiro, em agosto de 2026:
| Modelo na Cerebras | Tokens por segundo | Tempo até o primeiro token de resposta |
|---|---|---|
| GPT-OSS-120B | 1.851 | 1,55 s |
| Gemma 4 31B | 1.508 | 2,0 a 3,2 s |
Continua sendo uma diferença enorme contra os 100 a 400 tokens/s típicos de endpoints de GPU. Só que a vantagem é de uma ordem de grandeza, não de vinte vezes, e o tempo até a primeira resposta não é zero: é cerca de 1,5 segundo.
Quanto tempo o cliente aceita esperar
A resposta honesta: menos do que se costuma afirmar, e mais do que os artigos de marketing sugerem.
Não existe estudo sustentando limiares específicos de abandono por segundos em WhatsApp. O que existe, e é fonte clássica citável, são os limites de Miller consolidados por Nielsen: 1 segundo é o teto para não quebrar o fluxo de pensamento do usuário, e 10 segundos é o teto para manter a atenção dele na tarefa.
Com essa régua, o quadro fica claro:
- 1,55 s do GPT-OSS-120B na Cerebras: perto do limite de fluidez, ótima experiência;
- 8,63 s do Gemini 3.5 Flash-Lite com raciocínio: dentro da faixa em que a atenção começa a se perder;
- 16,76 s do Gemini 3.5 Flash em esforço alto: acima do limite de atenção.
E vale registrar um contraponto que contraria a intuição comercial: a pesquisa acadêmica não mostra que mais rápido é sempre melhor. Gnewuch e colegas, em estudo publicado no BISE em 2022 com 202 participantes, encontraram que resposta com atraso moderado aumenta a percepção de presença social e a intenção de uso em usuários novatos. Um estudo de 2025 no IJHCI mostrou que o indicador de "digitando" neutraliza boa parte da penalidade da latência.
A revolução da infraestrutura: o fenômeno Cerebras
Para entender por que a Cerebras consegue esses números, é preciso entender por que uma GPU é lenta gerando texto. E a resposta surpreende: não é falta de poder de cálculo, é falta de banda de memória.
Para gerar cada palavra, o chip precisa ler os pesos do modelo na memória. Numa GPU, esses pesos moram em memória externa e precisam atravessar um barramento até os núcleos. Os núcleos passam a maior parte do tempo parados, esperando dados. Quando o modelo não cabe em uma placa, ele é fatiado entre várias GPUs, e agora os dados também atravessam cabos entre placas.
A Cerebras atacou exatamente esse gargalo com uma decisão de engenharia que soa absurda. Um chip comum é fabricado em uma bolacha de silício de 300 mm que depois é cortada em centenas de pastilhas. A Cerebras não corta. O Wafer-Scale Engine 3 usa a bolacha inteira como um único processador:
Esse último item é o que muda o jogo: os pesos ficam na memória ultrarrápida dentro do silício, a poucos milímetros dos núcleos.
| Critério | Cluster de GPUs | Wafer-Scale Engine 3 |
|---|---|---|
| Onde ficam os pesos | Em memória externa ao chip | Em 44 GB de SRAM dentro do próprio silício |
| Caminho até os núcleos | Atravessa um barramento, com os núcleos parados esperando dados | Poucos milímetros, sem barramento externo |
| Modelo que não cabe em uma placa | É fatiado entre várias GPUs, com dados atravessando cabos entre placas | Não há fatiamento nem cabo entre placas |
Comparação construída a partir da descrição de arquitetura desta seção. O gargalo não é falta de poder de cálculo, é falta de banda de memória.
Qualidade de resposta: o que velocidade e preço não mostram
Chegamos à parte que a maioria dos comparativos, inclusive a primeira versão deste artigo, trata com adjetivo em vez de evidência.
Uma resposta pode estar factualmente correta e ainda ser ruim para o cliente: longa demais, robótica, formal demais, pouco convincente ou incompatível com a voz da empresa. Para atendimento comercial, qualidade se decompõe em pelo menos cinco dimensões:
- Naturalidade em português brasileiro: tratamento, contrações, ritmo de conversa, ausência de traduções literais.
- Aderência à voz da marca: manter tom consultivo, direto, técnico ou informal conforme a empresa.
- Competência comercial: fazer a pergunta certa, identificar a necessidade, lidar com objeção e conduzir ao próximo passo sem pressionar.
- Continuidade: não repetir pergunta já respondida, lembrar condições combinadas, adaptar-se ao histórico.
- Confiabilidade: não inventar preço, prazo ou política, e usar corretamente as ferramentas disponíveis.
O que os rankings públicos mostram, e o que eles não medem
O sinal público mais usado é a Arena, que coleta preferência humana em batalhas cegas entre modelos. No recorte de escrita, snapshot de 1º de agosto de 2026:
| Modelo | Posição em escrita | Pontuação |
|---|---|---|
| Claude Fable 5 | 1º | 1515 |
| Claude Opus 5 Max | 4º | 1494 |
| Claude Opus 5 High | 6º | 1483 |
| Gemini 3.6 Flash | 7º | 1483 |
| Gemini 3.5 Flash High | 10º | 1480 |
| Gemini 3.1 Pro Preview | 13º | 1479 |
| Claude Sonnet 5 High | 47º | 1446 |
| Gemini 3.5 Flash-Lite | 52º | 1443 |
| GPT-5.6 Luna XHigh | 56º | 1439 |
| Gemini 3.1 Flash-Lite | 75º | 1421 |
| Claude Haiku 4.5 | 106º | 1399 |
| Qwen3-235B sem thinking | 137º | 1379 |
| GPT-OSS-120B | 216º | 1310 |
Antes de usar essa tabela para decidir qualquer coisa, cinco ressalvas que praticamente a invalidam para o nosso caso de uso:
1. A categoria exclui, por definição, redação comercial. Esta é a mais grave. A própria documentação da Arena estabelece que "escreva um e-mail de agradecimento" não se qualifica na categoria de escrita; só a versão "humoristicamente sarcástica" se qualifica. A categoria ocupacional vem da classificação SOC do Bureau of Labor Statistics americano, e cobre escritores, editores e literatura, não atendimento. O ranking exclui exatamente o gênero de texto que estamos tentando comparar.
2. Não existe recorte de português. A Arena tem filtro de idioma para inglês, chinês, francês, alemão, espanhol, russo, japonês, coreano e polonês. Português não está na lista: a página de espanhol devolve leaderboard completo, a de português devolve página vazia. E um filtro genérico de português também não separaria o brasileiro do europeu, distinção que importa numa venda no Brasil.
3. O ranking premia o comportamento que o WhatsApp proíbe. Votantes da Arena favorecem respostas longas, elaboradas e ricas em markdown. A própria plataforma reconhece esse viés, tanto que criou um mecanismo de controle de estilo para tentar neutralizá-lo. O WhatsApp não renderiza título nem tabela, usa dialeto próprio de formatação e trunca visualmente. Uma boa resposta de atendimento tem duas a quatro linhas. A métrica é anticorrelacionada com o canal.
4. As diferenças no topo não são estatisticamente significativas. O site publica intervalos de posição por bootstrap. O Opus 5 Max aparece em 4º, mas seu intervalo vai de 1º a 18º. O Gemini 3.6 Flash aparece em 7º, com intervalo de 2º a 25º. Ele e o Opus 5 High empatam em 1483. Dizer que um é melhor que o outro é ler ruído como sinal.
5. O volume de votos por modelo é pequeno. A categoria tem mais de 1,8 milhão de votos no total, mas isso é a soma de todos os modelos. O Opus 5 Max tem cerca de 1.445 votos ali. O Gemma 4 31B tem 929 votos em escrita criativa.
O que dá para afirmar com honestidade
Depois das cinco ressalvas, sobra bem menos do que a tabela sugere. Sobra isto:
- A distância do GPT-OSS-120B em texto livre é grande demais para ser ruído. Ele está em 216º na categoria de escrita e em 240º em escrita criativa, contra top 10 dos modelos de fronteira. Intervalo de confiança não explica um abismo desse tamanho. Tratar o modelo mais rápido do catálogo da Cerebras como bom redator é a conclusão menos defensável do comparativo. Ele é excelente no que faz, e o que ele faz não é escrever bonito.
- Na faixa de topo, não dá para ordenar. Fable 5, Opus 5, Gemini 3.6 Flash e Gemini 3.5 Flash estão dentro do erro uns dos outros. Escolher entre eles por ranking é chute com aparência de método.
- O Gemma 4 31B é melhor do que a primeira versão deste artigo dizia. Ele aparece em 46º em seguir instruções, acima do GPT-5.6 Luna, que está em 51º. A frase "segue roteiro bem e improvisa mal" que publiquei antes não tinha teste nenhum por trás e foi removida.
E a conclusão que interessa, dita sem rodeio: não existe, até agosto de 2026, nenhuma avaliação pública comparando esses modelos em português brasileiro comercial. Nem a Arena, nem os índices de inteligência da Artificial Analysis, que são compostos por benchmarks de raciocínio científico, código e uso agêntico, todos em inglês. Quem afirmar que um modelo específico "escreve melhor em português" está dando opinião, não citando medição. Inclusive eu, na primeira versão deste texto.
Esses rankings servem para montar uma lista curta de candidatos. Não servem para escolher.
O jeito de saber é medir. Mais adiante eu descrevo como montar esse teste.
O comparativo completo: velocidade, custo e escrita
Preços em dólares por milhão de tokens, verificados em agosto de 2026.
| Modelo | Entrada | Saída | Contexto | Imagem | Escrita (Arena) |
|---|---|---|---|---|---|
| GPT-5.6 Luna | 0,20 | 1,20 | 1,05 M | Sim | 56º |
| Gemini 3.1 Flash-Lite | 0,25 | 1,50 | 1,05 M | Sim | 75º |
| Gemini 3.5 Flash-Lite | 0,30 | 2,50 | 1,05 M | Sim | 52º |
| GPT-OSS-120B (Cerebras) | 0,35 | 0,75 | 131 K | Não | 216º |
| Qwen3-235B (endpoint dedicado) | 0,60 | 1,20 | 262 K | Não | 137º |
| Gemma 4 31B (Cerebras) | 0,99 | 1,49 | 65 K livre, 131 K pago | Sim | 58º geral |
| Claude Haiku 4.5 | 1,00 | 5,00 | 200 K | Sim | 106º |
| Gemini 3.6 Flash | 1,50 | 7,50 | 1,05 M | Sim | 7º |
| Gemini 3.5 Flash | 1,50 | 9,00 | 1,05 M | Sim | 10º |
| Claude Sonnet 5 | 2,00 / 3,00 | 10,00 / 15,00 | 1 M | Sim | 47º |
| Gemini 3.1 Pro Preview | 2,00 | 12,00 | 1,05 M | Sim | 13º |
| Claude Opus 5 | 5,00 | 25,00 | 1 M | Sim | 4º a 6º |
| Claude Fable 5 | 10,00 | 50,00 | 1 M | Sim | 1º |
Três avisos que evitam erro de orçamento:
O Sonnet 5 tem preço com data de validade. Os US$ 2 / US$ 10 são promocionais e valem até 31 de agosto de 2026. A partir de 1º de setembro passam a US$ 3 / US$ 15. Se você está fazendo orçamento anual, use o preço cheio.
Tokens de raciocínio são cobrados como saída. Isso vale para Google e Anthropic. Uma resposta visível de 150 tokens pode gerar centenas ou milhares de tokens internos de pensamento, todos faturados na tarifa de saída, que é a cara. Pior: o esforço padrão da API do Opus 5 e do Sonnet 5 é alto. Deixar implícito num chatbot é assinar um cheque em branco de custo e de latência.
O preço do Luna não é universal. Existe uma faixa de contexto longo com tarifa mais alta. Se a sua arquitetura joga base de conhecimento inteira no prompt, confirme em qual faixa você cai antes de projetar custo.
Texto, imagem e PDF: o que cada modelo realmente aceita
Essa confusão custa retrabalho, e a família Qwen é o caso mais enganoso.
Qwen3-235B-A22B-Instruct-2507 e Qwen3-VL-235B-A22B-Instruct são modelos diferentes, não o mesmo modelo com visão ligada. O primeiro é estritamente textual: não lê imagem nem vídeo. O segundo é a versão multimodal, com OCR declarado em 32 idiomas e compreensão de vídeo.
Uma pegadinha adicional: os dois têm a mesma janela nativa. O textual documenta 262.144 tokens e o VL documenta 256K. É o mesmo número escrito de duas formas, porque 256 K equivale a 262.144. A extensão para cerca de 1 milhão no modelo textual não é padrão: exige habilitar técnicas específicas em deploy próprio.
| Modelo | Texto | Imagem | Vídeo | PDF enviado direto | Situação na Cerebras |
|---|---|---|---|---|---|
| Gemini 3.6 Flash | Sim | Sim | Sim | Sim | Não disponível |
| Claude Opus 5 e Sonnet 5 | Sim | Sim | Não | Sim, nativo | Não disponível |
| GPT-5.6 Luna | Sim | Sim | Não | Sim, pela Responses API | Não disponível |
| Gemma 4 31B | Sim | Sim | Não | Depende da integração | Prévia pública |
| GPT-OSS-120B | Sim | Não | Não | Exige extração externa | Produção pública |
| Qwen3-235B Instruct | Sim | Não | Não | Exige extração externa | Endpoint dedicado |
| Qwen3-VL-235B | Sim | Sim | Sim | Depende do provedor | Anunciado, ainda não disponível |
Sobre PDF, existem três casos que não devem ser confundidos:
- PDF com texto digital: basta extrair o texto com biblioteca e mandar para qualquer modelo textual. O modelo não está "lendo o PDF", a sua aplicação está.
- PDF escaneado, com tabela ou diagramação relevante: é preciso renderizar as páginas como imagem e usar um modelo com visão.
- API que aceita o arquivo direto: é capacidade do provedor, não só do modelo. Na Responses API da OpenAI, o PDF enviado tem o texto extraído e as páginas convertidas em imagem, e ambos vão para um modelo com visão.
Consequência prática: o modelo mais barato por token pode gerar a arquitetura mais cara, porque exige um pipeline de OCR, mais chamadas e mais pontos de falha.
Caso prático: quanto custa atender no WhatsApp
A base de cálculo
Uma conversa de qualificação e agendamento tem, na média, oito trocas. A cada nova mensagem a sua automação reenvia o prompt de sistema e o histórico, porque a API não guarda estado. Com prompt de sistema de 400 tokens, mensagens do cliente de 35 e respostas de 100, uma conversa consome:
- cerca de 8.000 tokens de entrada
- cerca de 800 tokens de saída
Uma conversa de suporte, mais longa, consome duas a três vezes isso. E se você usar modelo com raciocínio, some os tokens de pensamento na conta de saída.
Cenário 1: 100 clientes por dia
Cem conversas diárias somam 880 mil tokens por dia, e isso cabe dentro do teto diário de 1 milhão de tokens do Free Trial da Cerebras.
Só que aqui vale desfazer um mal-entendido comum, que estava inclusive numa versão anterior deste artigo: a Cerebras não tem camada gratuita permanente. A documentação é explícita ao responder se existe um plano gratuito: não existe. O que existe é um Free Trial limitado por tempo e crédito, com US$ 5 em créditos que expiram 30 dias depois de concedidos, e ele exige um método de pagamento verificado para ser liberado.
Ou seja: o 1 milhão de tokens por dia é um teto de vazão, não uma cota gratuita renovável. Serve para você validar a ideia por algumas semanas, não para operar de graça.
| Free Trial da Cerebras | O que vale hoje |
|---|---|
| Plano gratuito | Não existe plano gratuito permanente |
| Créditos | US$ 5, que expiram 30 dias depois de concedidos |
| Liberação | Exige método de pagamento verificado |
| Teto diário | 1 milhão de tokens, teto de vazão e não cota renovável |
| Requisições | 5 por minuto |
| Contexto | 65 mil tokens no gpt-oss-120b e no gemma-4-31b, 131 mil no pago |
Termos do Free Trial descritos ao longo do artigo. Confirme na documentação oficial antes de projetar volume.
Se preferir pagar para ter previsibilidade, o custo mensal para 3.000 conversas fica assim:
| Modelo | Custo mensal | Por conversa |
|---|---|---|
| GPT-5.6 Luna | US$ 7,68 | US$ 0,0026 |
| Gemini 3.1 Flash-Lite | US$ 9,60 | US$ 0,0032 |
| GPT-OSS-120B (Cerebras) | US$ 10,20 | US$ 0,0034 |
| Gemini 3.5 Flash-Lite | US$ 13,20 | US$ 0,0044 |
| Gemma 4 31B (Cerebras) | US$ 27,34 | US$ 0,0091 |
| Claude Haiku 4.5 | US$ 36,00 | US$ 0,0120 |
| Gemini 3.6 Flash | US$ 54,00 | US$ 0,0180 |
| Claude Sonnet 5 (preço cheio) | US$ 108,00 | US$ 0,0360 |
| Claude Opus 5 | US$ 180,00 | US$ 0,0600 |
| Claude Fable 5 | US$ 360,00 | US$ 0,1200 |
Cenário 2: 1.000 clientes por dia
Agora sim são 8,8 milhões de tokens por dia, muito além do teto do Free Trial. Trinta mil conversas por mês:
| Modelo | Custo mensal |
|---|---|
| GPT-5.6 Luna | US$ 76,80 |
| GPT-OSS-120B (Cerebras) | US$ 102,00 |
| Gemini 3.5 Flash-Lite | US$ 132,00 |
| Gemma 4 31B (Cerebras) | US$ 273,36 |
| Claude Haiku 4.5 | US$ 360,00 |
| Gemini 3.6 Flash | US$ 540,00 |
| Claude Opus 5 | US$ 1.800,00 |
| Claude Fable 5 | US$ 3.600,00 |
Trinta mil conversas por mês, com 8.000 tokens de entrada e 800 de saída por conversa. A linha destacada é a recomendada para o caminho quente do atendimento, não a mais barata da lista.
A métrica que realmente importa
Agora pergunte: quanto vale uma venda do seu produto?
Se o Gemini escreve melhor, resolve mais objeções, exige menos revisão humana, transfere menos casos para atendente e lê o print que o cliente mandou sem pipeline extra, US$ 43,80 por mês se paga com uma única conversão adicional na maioria dos negócios B2B brasileiros.
Por isso o indicador correto não é custo por milhão de tokens, nem custo por conversa. É:
Custo por conversa resolvida corretamente.
E a palavra "corretamente" precisa de definição, senão a métrica premia o comportamento errado. "Resolvida sem intervenção humana" conta o cliente que desistiu como sucesso, que é o oposto do que você quer medir. Defina assim:
- a conversa foi encerrada sem reabertura nem recontato em outro canal dentro de 7 dias;
- abandono conta como falha, não como resolução;
- há uma trava de qualidade junto, como uma nota de satisfação ou uma amostra revisada por humano.
Com essa definição, um modelo que custa US$ 0,003 e precisa de revisão em uma a cada cinco respostas pode sair muito mais caro que um de US$ 0,018 que resolve de primeira. O token é a menor linha do custo total: o caro é o tempo do seu time e o cliente perdido.
E há um detalhe de cache que muda a conta em prompts longos, porque "cache" significa três coisas diferentes em três fornecedores:
- OpenAI: leitura em cache dez vezes mais barata no Luna, de US$ 0,20 para US$ 0,02 por milhão. Mas a escrita no cache custa US$ 0,25 por milhão, então o ganho só aparece com reuso alto do mesmo prefixo.
- Google: escrita e leitura baratas, US$ 0,03 por milhão no 3.5 Flash-Lite, mais um custo de armazenamento de US$ 1,00 por milhão de tokens por hora, que corre independente de uso. Um cache grande mantido o dia inteiro tem o armazenamento dominando a conta.
- Cerebras: desconto nenhum. A documentação diz explicitamente que tokens servidos do cache são cobrados pela tarifa normal de entrada. O ganho é só de latência. E o cache existe apenas no
gpt-oss-120be nozai-glm-4.7: ogemma-4-31bnão tem cache, então qualquer argumento de economia com prompt longo no Gemma pela Cerebras simplesmente não se aplica.
A arquitetura que eu recomendaria
A conclusão honesta é que não existe vencedor único, porque os modelos vencem em dimensões diferentes. Mas também não vale inverter o erro e eleger um modelo de escrita bonita como padrão de um canal síncrono. O desenho correto é roteamento por tipo de turno, com caminho quente barato e rápido para a maioria esmagadora das mensagens.
Roteamento por tipo de turno, sobre a conexão oficial da WhatsApp Business Cloud API. No caminho quente entram classificar intenção, responder pergunta direta, consultar status, extrair campo e atualizar CRM; o anexo do cliente fica dentro da mesma pilha rápida; o documento complexo é contrato e análise que tolera segundos de espera, e também pode ir para o Claude; a negociação e a reclamação grave vão para o Opus 5, e a comunicação sensível, para o Fable 5. A aprovação humana continua obrigatória em preço especial, questão jurídica e decisão irreversível.
Repare que o Gemini 3.6 Flash não está no caminho quente, apesar do melhor sinal de escrita da faixa intermediária. O motivo é o número da seção de velocidade: 15,67 segundos até o primeiro token. Recomendá-lo como padrão de WhatsApp seria contradizer o limite de atenção de 10 segundos que este mesmo artigo usa como régua.
Dá para reduzir essa latência baixando o nível de raciocínio para mínimo, mas aí você joga fora exatamente a qualidade que estava comprando, e a comparação real passa a ser Gemini em modo mínimo contra GPT-OSS-120B na Cerebras, um duelo bem menos favorável.
Três impostos escondidos que ninguém coloca na planilha
Tokens de raciocínio no nível padrão. No Gemini 3.6 Flash, uma medição pública de 406 chamadas mostrou que no nível padrão cerca de 85% da conta de saída é raciocínio invisível, que nunca chega ao cliente. O custo efetivo fica bem acima do preço de tabela.
Assinaturas de pensamento. A linha Gemini 3.x exige devolver um campo de assinatura do raciocínio a cada rodada com chamada de ferramenta, sob pena de erro. Existem quebras documentadas em várias plataformas de orquestração, justamente porque proxies e plataformas de atendimento removem campos não padronizados do histórico. Atendimento multi-turno com consulta a CRM é exatamente esse cenário.
Capacidade compartilhada. A entrega do Gemini via Vertex é best-effort, com cota dinâmica compartilhada entre clientes. Garantia só com throughput provisionado, que é compromisso mensal fixo e derruba a premissa de custo intermediário. Vale lembrar que a Cerebras também é best-effort no pagamento por uso, com garantia apenas em contrato dedicado, e não tem região no Brasil.
Isso preserva a velocidade da Cerebras onde ela importa, que é no trabalho de alto volume, sem entregar a redação de mensagens delicadas ao modelo mais fraco em texto livre.
As três peças da implementação continuam sendo: conexão oficial pela WhatsApp Business Cloud API, uma camada de orquestração e tool calling bem implementado para consultar os seus sistemas. Se o atendimento responde sobre catálogo ou políticas, monte um RAG bem estruturado em vez de inflar o prompt de sistema. E antes de expor qualquer coisa, leia sobre proteção contra prompt injection.
Vale também questionar se você precisa de agente: boa parte do que se tenta resolver assim é integração bem feita.
Como montar o seu próprio teste em português
Como nenhum ranking mede português comercial brasileiro, o teste é seu. E ele é mais simples do que parece.
Monte de 40 a 60 casos reais anonimizados, cobrindo: primeiro contato, lead confuso com erro de digitação, qualificação, objeção de preço, follow-up, cliente irritado, negociação, tradução de assunto técnico para linguagem comercial, resumo para CRM, pedido de informação que você não tem, conversa longa com histórico e anexo de imagem ou PDF.
Rode em condições controladas: mesmo prompt de sistema, mesmo histórico, mesma base de conhecimento, mesmo limite de saída, nível de raciocínio declarado, três execuções por caso, com latência e custo registrados em separado.
Avalie às cegas e em pares. Mostre resposta A e resposta B sem dizer o modelo e pergunte qual é melhor. Pessoas escolhem entre duas opções com muito mais consistência do que atribuem nota absoluta.
Meça o que decide o negócio, e não a nota bonita: taxa de vitória por modelo, porcentagem de respostas aprovadas sem edição, erros graves por 100 respostas, tempo médio de edição humana, latência até a primeira resposta e, no fim, custo por resposta aprovada.
Esse teste custa alguns dias de trabalho e vale mais que qualquer leaderboard, porque mede a sua marca, o seu cliente e o seu português. Se você já tem métricas e logs de IA em produção e testes de regressão de prompts, metade da infraestrutura já está pronta.
Cinco armadilhas que ninguém conta
1. O teto de contexto do Free Trial é por modelo. Não existe um valor único. Na Cerebras, o gpt-oss-120b e o gemma-4-31b ficam em 65 mil tokens no trial e 131 mil no pago. Conversa longa com histórico acumulado esbarra nesse teto e passa a falhar. Resolva com janela deslizante, mantendo as últimas mensagens mais um resumo.
2. O Free Trial é de 5 requisições por minuto. Esse é o limite real, e ele é mais apertado do que o volume diário sugere. Uma conversa de oito turnos consome oito requisições. Na média do dia, 100 conversas cabem sem problema; num pico de cinco clientes escrevendo ao mesmo tempo, o limite estoura e o atendimento trava. Trate erro 429 com fila e nova tentativa desde o primeiro dia, não depois do primeiro incidente.
3. Raciocínio alto é caro e lento por padrão. O esforço padrão da API do Opus 5 e do Sonnet 5 é alto, e os tokens de pensamento são faturados como saída, inclusive a parte que a API não devolve para você ler. Quem estima custo contando os tokens visíveis da resposta subestima sempre.
A alavanca certa é reduzir o esforço, não desligar o raciocínio. A própria Anthropic documenta dois modos de falha ao desligar no Opus 5: a chamada de ferramenta pode sair como texto visível e nunca executar, sem erro nenhum, e podem vazar marcações internas de pensamento na resposta. No Fable 5 nem existe a opção, o raciocínio é sempre ativo, o que já o descarta como modelo padrão de chat.
Ponto de compliance que costuma passar batido: o Fable 5 não está disponível sob retenção zero de dados, exigindo retenção de 30 dias. Para cliente com essa exigência contratual, ele está fora antes de qualquer discussão de preço.
4. Modelo em prévia pode sair de linha. Isole a chamada do modelo atrás de uma camada própria no seu código, para que trocar de modelo seja mudar uma linha de configuração e não reescrever a integração.
5. Velocidade não conserta prompt ruim. Responder em 0,05 segundo com a informação errada é pior do que responder em três segundos com a informação certa. A infraestrutura resolve latência, e só o seu processo resolve qualidade.
- Janela deslizante no histórico, para não estourar os 65 mil tokens de contexto do Free Trial
- Fila e nova tentativa no erro 429 desde o primeiro dia, dentro das 5 requisições por minuto
- Nível de esforço de raciocínio declarado na chamada, em vez do padrão alto do Opus 5 e do Sonnet 5
- Camada própria isolando a chamada do modelo, para trocar de modelo em uma linha de configuração
- Prompt e processo revisados, porque responder em 0,05 segundo com a informação errada é pior do que responder em três segundos com a informação certa
Conclusão: três vencedores, não um
O mercado de 2026 não tem um campeão. Tem especialistas, e o erro caro é promover qualquer um deles a padrão universal.
A Cerebras vence em velocidade, e velocidade importa mais do que parece. O GPT-OSS-120B a 1.851 tokens/s com 1,55 segundo até a primeira resposta continua sendo a melhor escolha para o caminho quente do atendimento, onde estão 85% a 95% dos turnos. É também onde a latência se multiplica, porque um agente faz várias chamadas por resposta.
Nenhum modelo de escrita premium serve como padrão de canal síncrono. O Gemini 3.6 Flash tem o melhor sinal público de escrita da faixa intermediária e 15,67 segundos até o primeiro token. O Fable 5 lidera o ranking de escrita e nem permite desligar o raciocínio. Os dois são excelentes fora do caminho quente: documento complexo, negociação, texto que representa a empresa.
A multimodalidade é um portão de capacidade, não uma medida de qualidade. Se o cliente manda print e boleto, você precisa de um modelo com visão. Isso não significa que ele escreve melhor, e a pilha da Cerebras resolve esse ramo com o Gemma 4 31B sem sair da infraestrutura rápida.
O que mudou desde a primeira versão deste artigo não foi a infraestrutura, foi a régua. Velocidade continua sendo vantagem real e mensurável. Ela só não é, sozinha, uma resposta, e escrita bonita em ranking também não.
A decisão final não sai de tabela nenhuma, nem desta. Sai de medir custo por conversa resolvida corretamente com os seus casos, no seu português, com a sua marca. Nenhum benchmark público faz isso por você, porque nenhum deles mede português comercial brasileiro.
E você, de que lado está?
Você prefere economizar com modelos rápidos e baratos, aceitando revisão humana em parte das respostas, ou investir em qualidade máxima para que nenhum cliente perceba que fala com uma máquina, mesmo pagando cinco vezes mais?
Não existe resposta universal: depende do seu ticket médio e do custo real de perder um cliente por uma resposta boba. Conte nos comentários qual caminho você escolheu.
E se quiser discutir isso com números do seu volume real, fale com o nosso time sobre agentes de IA para empresas.
Perguntas frequentes
Não. A documentação é explícita ao dizer que não existe plano gratuito permanente. O que existe é um Free Trial com US$ 5 em créditos que expiram 30 dias depois de concedidos e que exige um método de pagamento verificado.
A Cerebras publica cerca de 3.000 tokens/s no próprio catálogo, número declarado pelo fornecedor. A Artificial Analysis, que mede de forma independente, registra 1.851 tokens/s, com 1,55 segundo até o primeiro token de resposta.
Porque ele leva 15,67 segundos até o primeiro token de resposta, contra uma mediana de 2,80 segundos da categoria, acima do limite de 10 segundos de atenção usado como régua no artigo. Ele continua excelente em documento complexo e em casos que toleram espera.
Com 8.000 tokens de entrada e 800 de saída por conversa, fica em US$ 10,20 no GPT-OSS-120B da Cerebras, US$ 54,00 no Gemini 3.6 Flash, US$ 180,00 no Claude Opus 5 e US$ 360,00 no Claude Fable 5.
Não, até agosto de 2026. A Arena não tem recorte de português e a categoria de escrita exclui, por definição, redação comercial. Os índices da Artificial Analysis são compostos por benchmarks de raciocínio científico, código e uso agêntico, todos em inglês.
Não. A documentação diz que tokens servidos do cache são cobrados pela tarifa normal de entrada, e o ganho é apenas de latência. O cache existe só no gpt-oss-120b e no zai-glm-4.7, então não vale para o gemma-4-31b.
Histórico de atualização
5 de agosto de 2026: revisão ampla após verificação independente das fontes, incluindo uma rodada de revisão adversarial que derrubou conclusões da própria revisão.
Correções de dado: a velocidade do GPT-OSS-120B na Cerebras passou de 3.000 para 1.851 tokens/s, porque os 3.000 eram número de divulgação da própria Cerebras e não medição independente; a do Gemma 4 31B passou de 1.851 para 1.508 tokens/s; o consumo de 100 conversas diárias foi corrigido de 8,8 milhões para 880 mil tokens por dia, o que inverte a conclusão e mostra que esse volume cabe no teto diário do trial; o teto de contexto do trial foi corrigido de 8 mil para 65 mil tokens no gpt-oss-120b e no gemma-4-31b; o limite de requisições foi especificado em 5 por minuto; e a descrição de "camada gratuita" foi corrigida, porque a Cerebras não tem plano gratuito permanente: o que existe é um Free Trial de US$ 5 em créditos que expiram em 30 dias e exige método de pagamento verificado.
Correções de raciocínio: a afirmação de que sete segundos de espera equivalem a abandono foi removida por falta de qualquer fonte, e substituída pelos limites de Miller consolidados por Nielsen, com o registro de que a literatura acadêmica mostra que atraso moderado pode até melhorar a percepção do atendimento. A frase "segue roteiro bem e improvisa mal" sobre o Gemma 4 foi removida por não ter teste algum por trás. A afirmação de que a qualidade extra dos modelos de fronteira não é percebida em mensagens curtas também saiu, pelo mesmo motivo.
Uma recomendação foi revertida durante a própria revisão: o Gemini 3.6 Flash chegou a ser indicado como modelo padrão de conversa, com base no sinal de escrita. A verificação de latência mostrou 15,67 segundos até o primeiro token, contra mediana de 2,80 s da categoria, o que o desqualifica para canal síncrono e contradiria a régua de atenção usada no próprio texto. Ele foi reposicionado para documentos e casos que toleram espera.
Foram acrescentadas a seção de qualidade de escrita com as ressalvas metodológicas da Arena, a linha Gemini e a linha Claude no comparativo, a distinção entre Qwen3 textual e Qwen3-VL, os impostos escondidos de raciocínio, assinatura de pensamento e capacidade compartilhada, e o método para montar um teste próprio em português.
Preços, velocidades e disponibilidade verificados em agosto de 2026. Medições de velocidade e latência são medianas móveis da Artificial Analysis e mudam com o tempo. Rankings de preferência humana referem-se ao snapshot de 1º de agosto de 2026 e não possuem recorte de português. Confirme os valores na documentação oficial antes de fechar um orçamento.