Montar SquadSolicitar Orçamento
Tecnologia4 de agosto de 202626 min de leituraAtualizado em 6 de setembro de 2026

IA no atendimento: escolher por velocidade, custo e qualidade

Compare Cerebras, Gemini, Claude, GPT-5.6 e modelos abertos em velocidade, custo e qualidade de escrita. Com a conta do WhatsApp, latência real medida e um método para testar português comercial.

Índice do artigo
faltam 26 min de leitura

Recomendação direta: escolha o modelo mais rápido e mais barato que ultrapassa o piso de qualidade que o seu atendimento exige. Velocidade é vantagem operacional, não substituto de naturalidade, persuasão ou aderência à voz da marca. E o piso de qualidade só você consegue medir, porque nenhum ranking público mede português comercial brasileiro.

Resumo do artigo

  • Parâmetro deixou de ser especificação: OpenAI e Anthropic pararam de publicar o tamanho dos modelos, e o Kimi K2.6 ativa cerca de 32 bilhões de parâmetros por token, não 1 trilhão.
  • Tokens por segundo não é o tempo que o cliente sente: até o primeiro token de resposta, o GPT-OSS-120B na Cerebras leva 1,55 s e o Gemini 3.6 Flash leva 15,67 s.
  • Três mil conversas por mês custam US$ 10,20 no GPT-OSS-120B e US$ 54,00 no Gemini 3.6 Flash, uma diferença de US$ 43,80 por mês.
  • A Cerebras não tem plano gratuito permanente: o Free Trial dá US$ 5 em créditos que expiram em 30 dias e exige método de pagamento verificado.
  • Nenhum ranking público mede português comercial brasileiro, então o indicador que decide é o custo por conversa resolvida corretamente, medido com os seus casos.

Durante três anos, o mercado comprou inteligência artificial como quem compra carro por cilindrada: quanto maior o número, melhor.

Em 2026 esse número virou nota de rodapé. As duas empresas que lideram os rankings de raciocínio, OpenAI e Anthropic, simplesmente pararam de publicar o tamanho dos seus modelos. O que elas publicam hoje é preço por milhão de tokens, janela de contexto, níveis de esforço de raciocínio e resultados de benchmark.

Só que o pêndulo foi longe demais para o outro lado. Trocar "quantos bilhões de parâmetros" por "quantos tokens por segundo" é o mesmo erro com outra métrica. Um atendimento que responde instantaneamente e escreve mal perde o cliente do mesmo jeito.

Este artigo compara os modelos disponíveis hoje nos três eixos que realmente decidem: velocidade, custo e qualidade de escrita. E mostra por que o terceiro é o mais difícil de medir, e o mais caro de errar.

Resumo rápido para quem tem pressa

Se o seu problema é...Escolha inicialPor quê
Classificar intenção, consultar status, atualizar CRMGPT-OSS-120B na Cerebras1.851 tokens/s medidos, US$ 0,35 por milhão de entrada, pesos abertos
Ler print, foto de boleto ou comprovanteGemma 4 31B na CerebrasAceita imagem direto, sem sair da infraestrutura rápida
Documento longo ou PDF complexoGemini 3.6 FlashMultimodal nativo e bom em texto, mas 15,67 s até responder
Negociação difícil, reclamação grave, propostaClaude Opus 5Topo de raciocínio, com custo que só se justifica por exceção
Texto de altíssimo valor, comunicação executivaClaude Fable 5Primeiro lugar em escrita nos rankings públicos, e o mais lento e caro
Validar a ideia gastando poucoFree Trial da CerebrasUS$ 5 em créditos que expiram em 30 dias, exige método de pagamento
Volume gigante com orçamento mínimoGPT-5.6 LunaUS$ 0,20 por milhão de entrada, o mais barato da comparação

Se quiser pular direto para os números, vá para a conta do WhatsApp. Se o seu problema é escolher por qualidade, vá para a seção de qualidade de resposta.

O fim da corrida dos parâmetros

A contagem de parâmetros morreu por três motivos concretos.

Primeiro: o número virou marketing. O Kimi K2.6, da Moonshot AI, tem 1 trilhão de parâmetros no papel. Só que ele usa uma arquitetura chamada Mixture-of-Experts, ou mistura de especialistas: em vez de acionar o modelo inteiro a cada palavra, um roteador escolhe apenas algumas sub-redes especializadas por token. Na prática, o Kimi K2.6 ativa cerca de 32 bilhões de parâmetros por token, não 1 trilhão. O GPT-OSS-120B tem 117 bilhões totais e ativa 5,1 bilhões. Dizer "modelo trilionário" descreve o tamanho do arquivo no disco, não a capacidade que roda a cada palavra.

Segundo: os líderes não contam mais. Ninguém fora da Anthropic sabe quantos parâmetros tem o Claude Opus 5. Ninguém fora da OpenAI sabe o tamanho do GPT-5.6 Sol. Circulam estimativas em fóruns técnicos, mas nenhuma é confirmada e nenhuma deveria entrar numa decisão de arquitetura.

Terceiro: modelos pequenos alcançaram os grandes em capacidade bruta. O Gemma 4 31B, do Google DeepMind, é um modelo denso de 30,7 bilhões de parâmetros com licença Apache 2.0, e disputa de igual para igual com modelos proprietários de entrada.

A conclusão prática é desconfortável: parâmetro deixou de ser especificação e virou taxa de compressão. A pergunta certa passou a ser "quantos tokens por segundo, a que custo, com que qualidade?".

E é na terceira parte dessa pergunta que quase todo mundo escorrega.

Velocidade: o que os números realmente dizem

Existe um erro de avaliação que se repete em quase todo projeto de atendimento. A equipe testa cinco modelos no playground, escolhe o que dá a melhor resposta e só descobre o problema em produção: o cliente não espera.

Só que medir isso por "tokens por segundo" engana, e engana feio.

Tokens por segundo não é o tempo que o cliente sente

Um modelo pode gerar texto muito rápido depois que começa e ainda assim demorar muito para começar. Quando o modelo raciocina antes de responder, o cliente fica olhando a tela durante todo o raciocínio.

A prova mais limpa disso é comparar o mesmo modelo consigo mesmo. O Gemini 3.5 Flash, no mesmo provedor, medido pela Artificial Analysis:

Gemini 3.5 FlashTokens por segundoTempo até o primeiro token de resposta
Esforço mínimo168,31,05 s
Esforço alto181,116,76 s

Repare: no esforço alto ele gera mais rápido, e mesmo assim o cliente espera dezesseis vezes mais. A variável não é a velocidade de geração, é o tempo de raciocínio antes da primeira palavra visível.

O mesmo padrão aparece no Gemini 3.5 Flash-Lite: 391,5 tokens/s, throughput muito acima da mediana da categoria, mas 8,63 segundos até o primeiro token de resposta.

E o caso mais importante para quem está escolhendo modelo agora é o Gemini 3.6 Flash, lançado em 21 de julho de 2026 e recomendado em vários comparativos recentes. Na configuração de esforço alto, a Artificial Analysis mede nele 212,7 tokens por segundo, bem acima da mediana de 72,8 t/s da categoria. E mede também 15,67 segundos até o primeiro token, contra uma mediana de 2,80 segundos entre modelos de raciocínio da mesma faixa de preço.

Ou seja: ele gera rápido e demora muito para começar. Para um relatório assíncrono, isso é irrelevante. Para alguém esperando no WhatsApp, é a diferença entre uma conversa e um abandono.

GPT-OSS-120B na Cerebras1,55 s
Mediana dos modelos de raciocínio da faixa2,80 s
Gemini 3.5 Flash-Lite, com raciocínio8,63 s
Gemini 3.6 Flash, esforço alto15,67 s
Gemini 3.5 Flash, esforço alto16,76 s
Tempo até o primeiro token de resposta, contado depois do raciocínio. Medições da Artificial Analysis citadas no texto; a mediana de 2,80 s é a dos modelos de raciocínio da mesma faixa de preço.

Onde a Cerebras realmente está

Aqui preciso corrigir um número que circula muito, inclusive em uma versão anterior deste artigo.

A Cerebras publica cerca de 3.000 tokens/s para o GPT-OSS-120B, e não é só num post antigo: o número está na coluna de velocidade do catálogo de modelos e na página do próprio modelo, na documentação vigente. Só que é número da própria empresa, sem medição independente citada. A Artificial Analysis mede 1.851 tokens/s e afirma na página de provedores que nenhum provedor chega perto de 3.000 tokens/s. Os dois são reais, com origens diferentes: um é especificação declarada pelo fornecedor, o outro é medição de terceiro.

Os números medidos por terceiro, em agosto de 2026:

Modelo na CerebrasTokens por segundoTempo até o primeiro token de resposta
GPT-OSS-120B1.8511,55 s
Gemma 4 31B1.5082,0 a 3,2 s

Continua sendo uma diferença enorme contra os 100 a 400 tokens/s típicos de endpoints de GPU. Só que a vantagem é de uma ordem de grandeza, não de vinte vezes, e o tempo até a primeira resposta não é zero: é cerca de 1,5 segundo.

Quanto tempo o cliente aceita esperar

A resposta honesta: menos do que se costuma afirmar, e mais do que os artigos de marketing sugerem.

Não existe estudo sustentando limiares específicos de abandono por segundos em WhatsApp. O que existe, e é fonte clássica citável, são os limites de Miller consolidados por Nielsen: 1 segundo é o teto para não quebrar o fluxo de pensamento do usuário, e 10 segundos é o teto para manter a atenção dele na tarefa.

Com essa régua, o quadro fica claro:

  • 1,55 s do GPT-OSS-120B na Cerebras: perto do limite de fluidez, ótima experiência;
  • 8,63 s do Gemini 3.5 Flash-Lite com raciocínio: dentro da faixa em que a atenção começa a se perder;
  • 16,76 s do Gemini 3.5 Flash em esforço alto: acima do limite de atenção.

E vale registrar um contraponto que contraria a intuição comercial: a pesquisa acadêmica não mostra que mais rápido é sempre melhor. Gnewuch e colegas, em estudo publicado no BISE em 2022 com 202 participantes, encontraram que resposta com atraso moderado aumenta a percepção de presença social e a intenção de uso em usuários novatos. Um estudo de 2025 no IJHCI mostrou que o indicador de "digitando" neutraliza boa parte da penalidade da latência.

A revolução da infraestrutura: o fenômeno Cerebras

Para entender por que a Cerebras consegue esses números, é preciso entender por que uma GPU é lenta gerando texto. E a resposta surpreende: não é falta de poder de cálculo, é falta de banda de memória.

Para gerar cada palavra, o chip precisa ler os pesos do modelo na memória. Numa GPU, esses pesos moram em memória externa e precisam atravessar um barramento até os núcleos. Os núcleos passam a maior parte do tempo parados, esperando dados. Quando o modelo não cabe em uma placa, ele é fatiado entre várias GPUs, e agora os dados também atravessam cabos entre placas.

A Cerebras atacou exatamente esse gargalo com uma decisão de engenharia que soa absurda. Um chip comum é fabricado em uma bolacha de silício de 300 mm que depois é cortada em centenas de pastilhas. A Cerebras não corta. O Wafer-Scale Engine 3 usa a bolacha inteira como um único processador:

46.000 mm²Área aproximada de silício
4 trilhõesTransistores no chip
900 milNúcleos dedicados a IA
44 GBMemória SRAM dentro do chip

Esse último item é o que muda o jogo: os pesos ficam na memória ultrarrápida dentro do silício, a poucos milímetros dos núcleos.

CritérioCluster de GPUsWafer-Scale Engine 3
Onde ficam os pesosEm memória externa ao chipEm 44 GB de SRAM dentro do próprio silício
Caminho até os núcleosAtravessa um barramento, com os núcleos parados esperando dadosPoucos milímetros, sem barramento externo
Modelo que não cabe em uma placaÉ fatiado entre várias GPUs, com dados atravessando cabos entre placasNão há fatiamento nem cabo entre placas

Comparação construída a partir da descrição de arquitetura desta seção. O gargalo não é falta de poder de cálculo, é falta de banda de memória.

Qualidade de resposta: o que velocidade e preço não mostram

Chegamos à parte que a maioria dos comparativos, inclusive a primeira versão deste artigo, trata com adjetivo em vez de evidência.

Uma resposta pode estar factualmente correta e ainda ser ruim para o cliente: longa demais, robótica, formal demais, pouco convincente ou incompatível com a voz da empresa. Para atendimento comercial, qualidade se decompõe em pelo menos cinco dimensões:

  1. Naturalidade em português brasileiro: tratamento, contrações, ritmo de conversa, ausência de traduções literais.
  2. Aderência à voz da marca: manter tom consultivo, direto, técnico ou informal conforme a empresa.
  3. Competência comercial: fazer a pergunta certa, identificar a necessidade, lidar com objeção e conduzir ao próximo passo sem pressionar.
  4. Continuidade: não repetir pergunta já respondida, lembrar condições combinadas, adaptar-se ao histórico.
  5. Confiabilidade: não inventar preço, prazo ou política, e usar corretamente as ferramentas disponíveis.

O que os rankings públicos mostram, e o que eles não medem

O sinal público mais usado é a Arena, que coleta preferência humana em batalhas cegas entre modelos. No recorte de escrita, snapshot de 1º de agosto de 2026:

ModeloPosição em escritaPontuação
Claude Fable 51515
Claude Opus 5 Max1494
Claude Opus 5 High1483
Gemini 3.6 Flash1483
Gemini 3.5 Flash High10º1480
Gemini 3.1 Pro Preview13º1479
Claude Sonnet 5 High47º1446
Gemini 3.5 Flash-Lite52º1443
GPT-5.6 Luna XHigh56º1439
Gemini 3.1 Flash-Lite75º1421
Claude Haiku 4.5106º1399
Qwen3-235B sem thinking137º1379
GPT-OSS-120B216º1310

Antes de usar essa tabela para decidir qualquer coisa, cinco ressalvas que praticamente a invalidam para o nosso caso de uso:

1. A categoria exclui, por definição, redação comercial. Esta é a mais grave. A própria documentação da Arena estabelece que "escreva um e-mail de agradecimento" não se qualifica na categoria de escrita; só a versão "humoristicamente sarcástica" se qualifica. A categoria ocupacional vem da classificação SOC do Bureau of Labor Statistics americano, e cobre escritores, editores e literatura, não atendimento. O ranking exclui exatamente o gênero de texto que estamos tentando comparar.

2. Não existe recorte de português. A Arena tem filtro de idioma para inglês, chinês, francês, alemão, espanhol, russo, japonês, coreano e polonês. Português não está na lista: a página de espanhol devolve leaderboard completo, a de português devolve página vazia. E um filtro genérico de português também não separaria o brasileiro do europeu, distinção que importa numa venda no Brasil.

3. O ranking premia o comportamento que o WhatsApp proíbe. Votantes da Arena favorecem respostas longas, elaboradas e ricas em markdown. A própria plataforma reconhece esse viés, tanto que criou um mecanismo de controle de estilo para tentar neutralizá-lo. O WhatsApp não renderiza título nem tabela, usa dialeto próprio de formatação e trunca visualmente. Uma boa resposta de atendimento tem duas a quatro linhas. A métrica é anticorrelacionada com o canal.

4. As diferenças no topo não são estatisticamente significativas. O site publica intervalos de posição por bootstrap. O Opus 5 Max aparece em 4º, mas seu intervalo vai de 1º a 18º. O Gemini 3.6 Flash aparece em 7º, com intervalo de 2º a 25º. Ele e o Opus 5 High empatam em 1483. Dizer que um é melhor que o outro é ler ruído como sinal.

5. O volume de votos por modelo é pequeno. A categoria tem mais de 1,8 milhão de votos no total, mas isso é a soma de todos os modelos. O Opus 5 Max tem cerca de 1.445 votos ali. O Gemma 4 31B tem 929 votos em escrita criativa.

O que dá para afirmar com honestidade

Depois das cinco ressalvas, sobra bem menos do que a tabela sugere. Sobra isto:

  • A distância do GPT-OSS-120B em texto livre é grande demais para ser ruído. Ele está em 216º na categoria de escrita e em 240º em escrita criativa, contra top 10 dos modelos de fronteira. Intervalo de confiança não explica um abismo desse tamanho. Tratar o modelo mais rápido do catálogo da Cerebras como bom redator é a conclusão menos defensável do comparativo. Ele é excelente no que faz, e o que ele faz não é escrever bonito.
  • Na faixa de topo, não dá para ordenar. Fable 5, Opus 5, Gemini 3.6 Flash e Gemini 3.5 Flash estão dentro do erro uns dos outros. Escolher entre eles por ranking é chute com aparência de método.
  • O Gemma 4 31B é melhor do que a primeira versão deste artigo dizia. Ele aparece em 46º em seguir instruções, acima do GPT-5.6 Luna, que está em 51º. A frase "segue roteiro bem e improvisa mal" que publiquei antes não tinha teste nenhum por trás e foi removida.

E a conclusão que interessa, dita sem rodeio: não existe, até agosto de 2026, nenhuma avaliação pública comparando esses modelos em português brasileiro comercial. Nem a Arena, nem os índices de inteligência da Artificial Analysis, que são compostos por benchmarks de raciocínio científico, código e uso agêntico, todos em inglês. Quem afirmar que um modelo específico "escreve melhor em português" está dando opinião, não citando medição. Inclusive eu, na primeira versão deste texto.

Esses rankings servem para montar uma lista curta de candidatos. Não servem para escolher.

O jeito de saber é medir. Mais adiante eu descrevo como montar esse teste.

O comparativo completo: velocidade, custo e escrita

Preços em dólares por milhão de tokens, verificados em agosto de 2026.

ModeloEntradaSaídaContextoImagemEscrita (Arena)
GPT-5.6 Luna0,201,201,05 MSim56º
Gemini 3.1 Flash-Lite0,251,501,05 MSim75º
Gemini 3.5 Flash-Lite0,302,501,05 MSim52º
GPT-OSS-120B (Cerebras)0,350,75131 KNão216º
Qwen3-235B (endpoint dedicado)0,601,20262 KNão137º
Gemma 4 31B (Cerebras)0,991,4965 K livre, 131 K pagoSim58º geral
Claude Haiku 4.51,005,00200 KSim106º
Gemini 3.6 Flash1,507,501,05 MSim
Gemini 3.5 Flash1,509,001,05 MSim10º
Claude Sonnet 52,00 / 3,0010,00 / 15,001 MSim47º
Gemini 3.1 Pro Preview2,0012,001,05 MSim13º
Claude Opus 55,0025,001 MSim4º a 6º
Claude Fable 510,0050,001 MSim

Três avisos que evitam erro de orçamento:

O Sonnet 5 tem preço com data de validade. Os US$ 2 / US$ 10 são promocionais e valem até 31 de agosto de 2026. A partir de 1º de setembro passam a US$ 3 / US$ 15. Se você está fazendo orçamento anual, use o preço cheio.

Tokens de raciocínio são cobrados como saída. Isso vale para Google e Anthropic. Uma resposta visível de 150 tokens pode gerar centenas ou milhares de tokens internos de pensamento, todos faturados na tarifa de saída, que é a cara. Pior: o esforço padrão da API do Opus 5 e do Sonnet 5 é alto. Deixar implícito num chatbot é assinar um cheque em branco de custo e de latência.

O preço do Luna não é universal. Existe uma faixa de contexto longo com tarifa mais alta. Se a sua arquitetura joga base de conhecimento inteira no prompt, confirme em qual faixa você cai antes de projetar custo.

Texto, imagem e PDF: o que cada modelo realmente aceita

Essa confusão custa retrabalho, e a família Qwen é o caso mais enganoso.

Qwen3-235B-A22B-Instruct-2507 e Qwen3-VL-235B-A22B-Instruct são modelos diferentes, não o mesmo modelo com visão ligada. O primeiro é estritamente textual: não lê imagem nem vídeo. O segundo é a versão multimodal, com OCR declarado em 32 idiomas e compreensão de vídeo.

Uma pegadinha adicional: os dois têm a mesma janela nativa. O textual documenta 262.144 tokens e o VL documenta 256K. É o mesmo número escrito de duas formas, porque 256 K equivale a 262.144. A extensão para cerca de 1 milhão no modelo textual não é padrão: exige habilitar técnicas específicas em deploy próprio.

ModeloTextoImagemVídeoPDF enviado diretoSituação na Cerebras
Gemini 3.6 FlashSimSimSimSimNão disponível
Claude Opus 5 e Sonnet 5SimSimNãoSim, nativoNão disponível
GPT-5.6 LunaSimSimNãoSim, pela Responses APINão disponível
Gemma 4 31BSimSimNãoDepende da integraçãoPrévia pública
GPT-OSS-120BSimNãoNãoExige extração externaProdução pública
Qwen3-235B InstructSimNãoNãoExige extração externaEndpoint dedicado
Qwen3-VL-235BSimSimSimDepende do provedorAnunciado, ainda não disponível

Sobre PDF, existem três casos que não devem ser confundidos:

  1. PDF com texto digital: basta extrair o texto com biblioteca e mandar para qualquer modelo textual. O modelo não está "lendo o PDF", a sua aplicação está.
  2. PDF escaneado, com tabela ou diagramação relevante: é preciso renderizar as páginas como imagem e usar um modelo com visão.
  3. API que aceita o arquivo direto: é capacidade do provedor, não só do modelo. Na Responses API da OpenAI, o PDF enviado tem o texto extraído e as páginas convertidas em imagem, e ambos vão para um modelo com visão.

Consequência prática: o modelo mais barato por token pode gerar a arquitetura mais cara, porque exige um pipeline de OCR, mais chamadas e mais pontos de falha.

Caso prático: quanto custa atender no WhatsApp

A base de cálculo

Uma conversa de qualificação e agendamento tem, na média, oito trocas. A cada nova mensagem a sua automação reenvia o prompt de sistema e o histórico, porque a API não guarda estado. Com prompt de sistema de 400 tokens, mensagens do cliente de 35 e respostas de 100, uma conversa consome:

  • cerca de 8.000 tokens de entrada
  • cerca de 800 tokens de saída

Uma conversa de suporte, mais longa, consome duas a três vezes isso. E se você usar modelo com raciocínio, some os tokens de pensamento na conta de saída.

Cenário 1: 100 clientes por dia

Cem conversas diárias somam 880 mil tokens por dia, e isso cabe dentro do teto diário de 1 milhão de tokens do Free Trial da Cerebras.

Só que aqui vale desfazer um mal-entendido comum, que estava inclusive numa versão anterior deste artigo: a Cerebras não tem camada gratuita permanente. A documentação é explícita ao responder se existe um plano gratuito: não existe. O que existe é um Free Trial limitado por tempo e crédito, com US$ 5 em créditos que expiram 30 dias depois de concedidos, e ele exige um método de pagamento verificado para ser liberado.

Ou seja: o 1 milhão de tokens por dia é um teto de vazão, não uma cota gratuita renovável. Serve para você validar a ideia por algumas semanas, não para operar de graça.

Free Trial da CerebrasO que vale hoje
Plano gratuitoNão existe plano gratuito permanente
CréditosUS$ 5, que expiram 30 dias depois de concedidos
LiberaçãoExige método de pagamento verificado
Teto diário1 milhão de tokens, teto de vazão e não cota renovável
Requisições5 por minuto
Contexto65 mil tokens no gpt-oss-120b e no gemma-4-31b, 131 mil no pago

Termos do Free Trial descritos ao longo do artigo. Confirme na documentação oficial antes de projetar volume.

Se preferir pagar para ter previsibilidade, o custo mensal para 3.000 conversas fica assim:

ModeloCusto mensalPor conversa
GPT-5.6 LunaUS$ 7,68US$ 0,0026
Gemini 3.1 Flash-LiteUS$ 9,60US$ 0,0032
GPT-OSS-120B (Cerebras)US$ 10,20US$ 0,0034
Gemini 3.5 Flash-LiteUS$ 13,20US$ 0,0044
Gemma 4 31B (Cerebras)US$ 27,34US$ 0,0091
Claude Haiku 4.5US$ 36,00US$ 0,0120
Gemini 3.6 FlashUS$ 54,00US$ 0,0180
Claude Sonnet 5 (preço cheio)US$ 108,00US$ 0,0360
Claude Opus 5US$ 180,00US$ 0,0600
Claude Fable 5US$ 360,00US$ 0,1200

Cenário 2: 1.000 clientes por dia

Agora sim são 8,8 milhões de tokens por dia, muito além do teto do Free Trial. Trinta mil conversas por mês:

ModeloCusto mensal
GPT-5.6 LunaUS$ 76,80
GPT-OSS-120B (Cerebras)US$ 102,00
Gemini 3.5 Flash-LiteUS$ 132,00
Gemma 4 31B (Cerebras)US$ 273,36
Claude Haiku 4.5US$ 360,00
Gemini 3.6 FlashUS$ 540,00
Claude Opus 5US$ 1.800,00
Claude Fable 5US$ 3.600,00

Trinta mil conversas por mês, com 8.000 tokens de entrada e 800 de saída por conversa. A linha destacada é a recomendada para o caminho quente do atendimento, não a mais barata da lista.

A métrica que realmente importa

US$ 10,20GPT-OSS-120B, 3.000 conversas
US$ 54,00Gemini 3.6 Flash, mesmas conversas
US$ 43,80Diferença por mês
5xQuanto o Gemini custa a mais

Agora pergunte: quanto vale uma venda do seu produto?

Se o Gemini escreve melhor, resolve mais objeções, exige menos revisão humana, transfere menos casos para atendente e lê o print que o cliente mandou sem pipeline extra, US$ 43,80 por mês se paga com uma única conversão adicional na maioria dos negócios B2B brasileiros.

Por isso o indicador correto não é custo por milhão de tokens, nem custo por conversa. É:

Custo por conversa resolvida corretamente.

E a palavra "corretamente" precisa de definição, senão a métrica premia o comportamento errado. "Resolvida sem intervenção humana" conta o cliente que desistiu como sucesso, que é o oposto do que você quer medir. Defina assim:

  • a conversa foi encerrada sem reabertura nem recontato em outro canal dentro de 7 dias;
  • abandono conta como falha, não como resolução;
  • há uma trava de qualidade junto, como uma nota de satisfação ou uma amostra revisada por humano.

Com essa definição, um modelo que custa US$ 0,003 e precisa de revisão em uma a cada cinco respostas pode sair muito mais caro que um de US$ 0,018 que resolve de primeira. O token é a menor linha do custo total: o caro é o tempo do seu time e o cliente perdido.

E há um detalhe de cache que muda a conta em prompts longos, porque "cache" significa três coisas diferentes em três fornecedores:

  • OpenAI: leitura em cache dez vezes mais barata no Luna, de US$ 0,20 para US$ 0,02 por milhão. Mas a escrita no cache custa US$ 0,25 por milhão, então o ganho só aparece com reuso alto do mesmo prefixo.
  • Google: escrita e leitura baratas, US$ 0,03 por milhão no 3.5 Flash-Lite, mais um custo de armazenamento de US$ 1,00 por milhão de tokens por hora, que corre independente de uso. Um cache grande mantido o dia inteiro tem o armazenamento dominando a conta.
  • Cerebras: desconto nenhum. A documentação diz explicitamente que tokens servidos do cache são cobrados pela tarifa normal de entrada. O ganho é só de latência. E o cache existe apenas no gpt-oss-120b e no zai-glm-4.7: o gemma-4-31b não tem cache, então qualquer argumento de economia com prompt longo no Gemma pela Cerebras simplesmente não se aplica.

A arquitetura que eu recomendaria

A conclusão honesta é que não existe vencedor único, porque os modelos vencem em dimensões diferentes. Mas também não vale inverter o erro e eleger um modelo de escrita bonita como padrão de um canal síncrono. O desenho correto é roteamento por tipo de turno, com caminho quente barato e rápido para a maioria esmagadora das mensagens.

Camada de orquestraçãoEscolhe o modelo a cada mensagem
GPT-OSS-120B na CerebrasCaminho quente, 85% a 95% dos turnos
Gemma 4 31B na CerebrasPrint, foto de documento e comprovante
Gemini 3.6 FlashDocumento complexo e PDF longo
Claude Opus 5Objeção difícil, proposta e conflito
Claude Fable 5Conta estratégica, crise, texto executivo
Aprovação humanaPreço especial e decisão irreversível

Roteamento por tipo de turno, sobre a conexão oficial da WhatsApp Business Cloud API. No caminho quente entram classificar intenção, responder pergunta direta, consultar status, extrair campo e atualizar CRM; o anexo do cliente fica dentro da mesma pilha rápida; o documento complexo é contrato e análise que tolera segundos de espera, e também pode ir para o Claude; a negociação e a reclamação grave vão para o Opus 5, e a comunicação sensível, para o Fable 5. A aprovação humana continua obrigatória em preço especial, questão jurídica e decisão irreversível.

Repare que o Gemini 3.6 Flash não está no caminho quente, apesar do melhor sinal de escrita da faixa intermediária. O motivo é o número da seção de velocidade: 15,67 segundos até o primeiro token. Recomendá-lo como padrão de WhatsApp seria contradizer o limite de atenção de 10 segundos que este mesmo artigo usa como régua.

Dá para reduzir essa latência baixando o nível de raciocínio para mínimo, mas aí você joga fora exatamente a qualidade que estava comprando, e a comparação real passa a ser Gemini em modo mínimo contra GPT-OSS-120B na Cerebras, um duelo bem menos favorável.

Três impostos escondidos que ninguém coloca na planilha

Tokens de raciocínio no nível padrão. No Gemini 3.6 Flash, uma medição pública de 406 chamadas mostrou que no nível padrão cerca de 85% da conta de saída é raciocínio invisível, que nunca chega ao cliente. O custo efetivo fica bem acima do preço de tabela.

Assinaturas de pensamento. A linha Gemini 3.x exige devolver um campo de assinatura do raciocínio a cada rodada com chamada de ferramenta, sob pena de erro. Existem quebras documentadas em várias plataformas de orquestração, justamente porque proxies e plataformas de atendimento removem campos não padronizados do histórico. Atendimento multi-turno com consulta a CRM é exatamente esse cenário.

Capacidade compartilhada. A entrega do Gemini via Vertex é best-effort, com cota dinâmica compartilhada entre clientes. Garantia só com throughput provisionado, que é compromisso mensal fixo e derruba a premissa de custo intermediário. Vale lembrar que a Cerebras também é best-effort no pagamento por uso, com garantia apenas em contrato dedicado, e não tem região no Brasil.

Isso preserva a velocidade da Cerebras onde ela importa, que é no trabalho de alto volume, sem entregar a redação de mensagens delicadas ao modelo mais fraco em texto livre.

As três peças da implementação continuam sendo: conexão oficial pela WhatsApp Business Cloud API, uma camada de orquestração e tool calling bem implementado para consultar os seus sistemas. Se o atendimento responde sobre catálogo ou políticas, monte um RAG bem estruturado em vez de inflar o prompt de sistema. E antes de expor qualquer coisa, leia sobre proteção contra prompt injection.

Vale também questionar se você precisa de agente: boa parte do que se tenta resolver assim é integração bem feita.

Como montar o seu próprio teste em português

Como nenhum ranking mede português comercial brasileiro, o teste é seu. E ele é mais simples do que parece.

Monte de 40 a 60 casos reais anonimizados, cobrindo: primeiro contato, lead confuso com erro de digitação, qualificação, objeção de preço, follow-up, cliente irritado, negociação, tradução de assunto técnico para linguagem comercial, resumo para CRM, pedido de informação que você não tem, conversa longa com histórico e anexo de imagem ou PDF.

Rode em condições controladas: mesmo prompt de sistema, mesmo histórico, mesma base de conhecimento, mesmo limite de saída, nível de raciocínio declarado, três execuções por caso, com latência e custo registrados em separado.

Avalie às cegas e em pares. Mostre resposta A e resposta B sem dizer o modelo e pergunte qual é melhor. Pessoas escolhem entre duas opções com muito mais consistência do que atribuem nota absoluta.

Meça o que decide o negócio, e não a nota bonita: taxa de vitória por modelo, porcentagem de respostas aprovadas sem edição, erros graves por 100 respostas, tempo médio de edição humana, latência até a primeira resposta e, no fim, custo por resposta aprovada.

Esse teste custa alguns dias de trabalho e vale mais que qualquer leaderboard, porque mede a sua marca, o seu cliente e o seu português. Se você já tem métricas e logs de IA em produção e testes de regressão de prompts, metade da infraestrutura já está pronta.

Cinco armadilhas que ninguém conta

1. O teto de contexto do Free Trial é por modelo. Não existe um valor único. Na Cerebras, o gpt-oss-120b e o gemma-4-31b ficam em 65 mil tokens no trial e 131 mil no pago. Conversa longa com histórico acumulado esbarra nesse teto e passa a falhar. Resolva com janela deslizante, mantendo as últimas mensagens mais um resumo.

2. O Free Trial é de 5 requisições por minuto. Esse é o limite real, e ele é mais apertado do que o volume diário sugere. Uma conversa de oito turnos consome oito requisições. Na média do dia, 100 conversas cabem sem problema; num pico de cinco clientes escrevendo ao mesmo tempo, o limite estoura e o atendimento trava. Trate erro 429 com fila e nova tentativa desde o primeiro dia, não depois do primeiro incidente.

3. Raciocínio alto é caro e lento por padrão. O esforço padrão da API do Opus 5 e do Sonnet 5 é alto, e os tokens de pensamento são faturados como saída, inclusive a parte que a API não devolve para você ler. Quem estima custo contando os tokens visíveis da resposta subestima sempre.

A alavanca certa é reduzir o esforço, não desligar o raciocínio. A própria Anthropic documenta dois modos de falha ao desligar no Opus 5: a chamada de ferramenta pode sair como texto visível e nunca executar, sem erro nenhum, e podem vazar marcações internas de pensamento na resposta. No Fable 5 nem existe a opção, o raciocínio é sempre ativo, o que já o descarta como modelo padrão de chat.

Ponto de compliance que costuma passar batido: o Fable 5 não está disponível sob retenção zero de dados, exigindo retenção de 30 dias. Para cliente com essa exigência contratual, ele está fora antes de qualquer discussão de preço.

4. Modelo em prévia pode sair de linha. Isole a chamada do modelo atrás de uma camada própria no seu código, para que trocar de modelo seja mudar uma linha de configuração e não reescrever a integração.

5. Velocidade não conserta prompt ruim. Responder em 0,05 segundo com a informação errada é pior do que responder em três segundos com a informação certa. A infraestrutura resolve latência, e só o seu processo resolve qualidade.

  • Janela deslizante no histórico, para não estourar os 65 mil tokens de contexto do Free Trial
  • Fila e nova tentativa no erro 429 desde o primeiro dia, dentro das 5 requisições por minuto
  • Nível de esforço de raciocínio declarado na chamada, em vez do padrão alto do Opus 5 e do Sonnet 5
  • Camada própria isolando a chamada do modelo, para trocar de modelo em uma linha de configuração
  • Prompt e processo revisados, porque responder em 0,05 segundo com a informação errada é pior do que responder em três segundos com a informação certa

Conclusão: três vencedores, não um

O mercado de 2026 não tem um campeão. Tem especialistas, e o erro caro é promover qualquer um deles a padrão universal.

A Cerebras vence em velocidade, e velocidade importa mais do que parece. O GPT-OSS-120B a 1.851 tokens/s com 1,55 segundo até a primeira resposta continua sendo a melhor escolha para o caminho quente do atendimento, onde estão 85% a 95% dos turnos. É também onde a latência se multiplica, porque um agente faz várias chamadas por resposta.

Nenhum modelo de escrita premium serve como padrão de canal síncrono. O Gemini 3.6 Flash tem o melhor sinal público de escrita da faixa intermediária e 15,67 segundos até o primeiro token. O Fable 5 lidera o ranking de escrita e nem permite desligar o raciocínio. Os dois são excelentes fora do caminho quente: documento complexo, negociação, texto que representa a empresa.

A multimodalidade é um portão de capacidade, não uma medida de qualidade. Se o cliente manda print e boleto, você precisa de um modelo com visão. Isso não significa que ele escreve melhor, e a pilha da Cerebras resolve esse ramo com o Gemma 4 31B sem sair da infraestrutura rápida.

O que mudou desde a primeira versão deste artigo não foi a infraestrutura, foi a régua. Velocidade continua sendo vantagem real e mensurável. Ela só não é, sozinha, uma resposta, e escrita bonita em ranking também não.

A decisão final não sai de tabela nenhuma, nem desta. Sai de medir custo por conversa resolvida corretamente com os seus casos, no seu português, com a sua marca. Nenhum benchmark público faz isso por você, porque nenhum deles mede português comercial brasileiro.

E você, de que lado está?

Você prefere economizar com modelos rápidos e baratos, aceitando revisão humana em parte das respostas, ou investir em qualidade máxima para que nenhum cliente perceba que fala com uma máquina, mesmo pagando cinco vezes mais?

Não existe resposta universal: depende do seu ticket médio e do custo real de perder um cliente por uma resposta boba. Conte nos comentários qual caminho você escolheu.

E se quiser discutir isso com números do seu volume real, fale com o nosso time sobre agentes de IA para empresas.

Perguntas frequentes

Não. A documentação é explícita ao dizer que não existe plano gratuito permanente. O que existe é um Free Trial com US$ 5 em créditos que expiram 30 dias depois de concedidos e que exige um método de pagamento verificado.


Histórico de atualização

5 de agosto de 2026: revisão ampla após verificação independente das fontes, incluindo uma rodada de revisão adversarial que derrubou conclusões da própria revisão.

Correções de dado: a velocidade do GPT-OSS-120B na Cerebras passou de 3.000 para 1.851 tokens/s, porque os 3.000 eram número de divulgação da própria Cerebras e não medição independente; a do Gemma 4 31B passou de 1.851 para 1.508 tokens/s; o consumo de 100 conversas diárias foi corrigido de 8,8 milhões para 880 mil tokens por dia, o que inverte a conclusão e mostra que esse volume cabe no teto diário do trial; o teto de contexto do trial foi corrigido de 8 mil para 65 mil tokens no gpt-oss-120b e no gemma-4-31b; o limite de requisições foi especificado em 5 por minuto; e a descrição de "camada gratuita" foi corrigida, porque a Cerebras não tem plano gratuito permanente: o que existe é um Free Trial de US$ 5 em créditos que expiram em 30 dias e exige método de pagamento verificado.

Correções de raciocínio: a afirmação de que sete segundos de espera equivalem a abandono foi removida por falta de qualquer fonte, e substituída pelos limites de Miller consolidados por Nielsen, com o registro de que a literatura acadêmica mostra que atraso moderado pode até melhorar a percepção do atendimento. A frase "segue roteiro bem e improvisa mal" sobre o Gemma 4 foi removida por não ter teste algum por trás. A afirmação de que a qualidade extra dos modelos de fronteira não é percebida em mensagens curtas também saiu, pelo mesmo motivo.

Uma recomendação foi revertida durante a própria revisão: o Gemini 3.6 Flash chegou a ser indicado como modelo padrão de conversa, com base no sinal de escrita. A verificação de latência mostrou 15,67 segundos até o primeiro token, contra mediana de 2,80 s da categoria, o que o desqualifica para canal síncrono e contradiria a régua de atenção usada no próprio texto. Ele foi reposicionado para documentos e casos que toleram espera.

Foram acrescentadas a seção de qualidade de escrita com as ressalvas metodológicas da Arena, a linha Gemini e a linha Claude no comparativo, a distinção entre Qwen3 textual e Qwen3-VL, os impostos escondidos de raciocínio, assinatura de pensamento e capacidade compartilhada, e o método para montar um teste próprio em português.

Preços, velocidades e disponibilidade verificados em agosto de 2026. Medições de velocidade e latência são medianas móveis da Artificial Analysis e mudam com o tempo. Rankings de preferência humana referem-se ao snapshot de 1º de agosto de 2026 e não possuem recorte de português. Confirme os valores na documentação oficial antes de fechar um orçamento.

Post anterior
E-mail transacional: os provedores grátis e os mais baratos em 2026
Próximo post
Agentes que usam o computador: o que o benchmark OSWorld 2.0 mostra
Newsletter

Um e-mail por mês, sem ruído

O que aprendemos entregando software sob medida e IA aplicada.

Artigos similares

GPT-5.6 Spark existe? O que a OpenAI e a Cerebras realmente anunciaram15 min · Tecnologia
Modelo da Cerebras para RAG rápido: qual usar e o que o pipeline exige10 min · Tecnologia
Qual IA usar para criar protótipos de software em 2026?9 min · Tecnologia
Qual IA usar em cada etapa do desenvolvimento de software14 min · Tecnologia
O que é web app e quais são seus benefícios?10 min · Tecnologia

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English