Blog
Nossas últimas novidadesCréditos do Codex: quanto custa cada modelo e esforço em 2026
A regra de bolso: o modelo define a tarifa por token (Sol custa 25x o Luna; Terra, 10x). O esforço de raciocínio define quantos tokens a tarefa vai gastar, e o Max leva um único agente ao raciocínio mais profundo. O Ultra multiplica tudo, porque pode delegar o trabalho a vários agentes e os tokens de todos entram na conta. Quem entende essas alavancas tende a gastar muito menos crédito para entregar o mesmo resultado.
Desde abril de 2026, o Codex cobra o uso da assinatura do ChatGPT do mesmo jeito que a API cobra desenvolvedores: por token, convertido em créditos. Isso acabou com a conta simples de "mensagens por janela" e criou uma dúvida nova sobre o consumo de créditos do Codex para quem usa Sol, Terra, Luna e Spark todos os dias: qual combinação de modelo e esforço entrega o resultado gastando menos?
Este guia responde com números oficiais: as tarifas de cada modelo, a fórmula que explica o consumo, o que o Ultra faz de verdade com seus créditos e as comparações que importam na prática. Ele complementa o nosso guia de qual modelo escolher entre Sol, Terra e Luna: lá, o critério é capacidade; aqui, o critério é custo.
Este artigo foi revisado em 30 de julho de 2026, dia em que a OpenAI anunciou um corte de preços justamente nesses modelos. Tarifas mudam com frequência: trate o rate card oficial do Codex como fonte de verdade e o painel Configurações do Codex → Uso (Codex Settings → Usage) como o medidor da sua conta.
Como o Codex cobra em 2026
O Codex cobra por token convertido em créditos: cada tarefa consome tokens de entrada, entrada cacheada e saída (incluindo o raciocínio), e o total é multiplicado pela tarifa do modelo escolhido. Plus e Pro incluem uma franquia de uso; o que passar dela desconta do saldo de créditos comprados.
Quatro regras explicam o sistema inteiro:
- Tudo é token. Cada tarefa consome tokens de entrada (o contexto que o modelo lê), tokens de entrada cacheada (contexto repetido, muito mais barato) e tokens de saída. A cobrança por mensagem acabou em abril de 2026.
- Raciocínio é saída. Os tokens que o modelo gasta "pensando" são cobrados como tokens de saída, mesmo que você nunca os veja. É por isso que subir o esforço de raciocínio aumenta o consumo sem mudar a tarifa.
- A franquia do plano vem primeiro. Plus e Pro incluem uma franquia de uso que renova em janela móvel. Quando ela acaba, o uso passa a debitar do saldo de créditos comprados, se houver. Créditos valem 12 meses e o mesmo pool é compartilhado com outros recursos agênticos da conta, como o ChatGPT Work.
- Uma mensagem típica com GPT-5.6 consome entre 5 e 40 créditos, segundo a própria OpenAI. Uma tarefa completa pode somar várias mensagens, e execuções com Ultra ou contexto muito grande passam disso com folga.
O rate card do Codex: tarifas oficiais por modelo
Valores do rate card oficial em 30 de julho de 2026, em créditos por 1 milhão de tokens:
| Modelo | Entrada | Entrada cacheada | Saída (inclui raciocínio) | Custo relativo |
|---|---|---|---|---|
| GPT-5.6 Sol | 125 | 12,5 | 750 | 25x Luna |
| GPT-5.6 Terra | 50 | 5 | 300 | 10x Luna |
| GPT-5.6 Luna | 5 | 0,5 | 30 | 1x |
| GPT-5.3 Codex Spark | Não definida | Não definida | Não definida | Cota separada no preview |
Três proporções valem para toda a família e simplificam qualquer conta:
- Saída custa 6x a entrada. Uma tarefa que escreve ou raciocina muito pesa mais do que uma tarefa que só lê muito.
- Ler do cache custa 1/10 da entrada. Reaproveitar contexto em uma mesma sessão reduz muito o consumo. Na API, os modelos GPT-5.6 cobram a gravação do cache a 1,25x a entrada; o rate card do Codex não publica essa tarifa, então a economia garantida está na leitura.
- Sol = 2,5x Terra = 25x Luna, por token, em qualquer mistura de entrada e saída.
A notícia de 30 de julho: a OpenAI reduziu os preços da família GPT-5.6: Terra ficou 20% mais barato e Luna, 80% mais barato na API, com o corte refletido também na forma como o uso desconta das assinaturas. Sol não mudou. Na prática, os modelos econômicos ficaram ainda mais econômicos; confira o rate card na data em que você estiver lendo.
A fórmula que explica o consumo de créditos do Codex
Como cache custa 1/10 da entrada e saída custa 6x, dá para resumir qualquer execução em uma unidade ponderada:
W = E + 0,1 × C + 6 × S
E = tokens de entrada não cacheados
C = tokens de entrada cacheados
S = tokens de saída, incluindo raciocínioOs créditos são a tarifa do modelo aplicada sobre W. Exemplo real: uma tarefa que lê 100 mil tokens novos e produz 20 mil tokens de saída e raciocínio tem W = 220.000. O custo nos três modelos:
| Modelo | Créditos na mesma execução |
|---|---|
| Luna | 1,1 |
| Terra | 11 |
| Sol | 27,5 |
Essa tabela carrega a lição mais importante do guia: com o mesmo volume de tokens, a mesma tarefa custa 25x mais em Sol do que em Luna. O esforço de raciocínio não muda a tarifa; muda o S da fórmula. Subir o esforço em um modelo barato costuma custar menos do que descer o esforço em um modelo caro.
Esforço de raciocínio: a segunda alavanca
O esforço de raciocínio do Codex define quantos tokens o modelo dedica a pensar antes de responder. Ele não muda a tarifa por token: muda o volume de tokens de saída, então o mesmo nível custa valores muito diferentes em Luna, Terra e Sol.
No aplicativo em português, os níveis aparecem como Leve, Médio, Alto, Extra alto, Máximo e Ultra; no CLI e na API, a família GPT-5.6 aceita valores como none, low, medium, high, xhigh e max, e cada modelo suporta um subconjunto próprio. Nos guias da X-Apps chamamos o primeiro nível de Baixo (o low da API) e o Máximo de Max, por consistência com os demais artigos da série.
O ponto central: não existe tabela oficial de "quanto custa cada esforço". Extra alto não custa "2x o Médio"; ele apenas tende a gastar mais tokens de raciocínio, e cada token segue a tarifa do modelo. O mapa realista das interseções:
| Modelo \ esforço | Baixo | Médio | Alto | Extra alto | Max | Ultra |
|---|---|---|---|---|---|---|
| Spark | cota própria, tokens baixos | cota própria | cota própria, mais tokens | cota própria, muitos tokens | não há | não há |
| Luna | 1x, tokens baixos | 1x | 1x, mais tokens | 1x, muitos tokens | 1x, máximo de um agente | conforme disponibilidade |
| Terra | 10x, tokens baixos | 10x | 10x, mais tokens | 10x, muitos tokens | 10x, máximo de um agente | 10x, multiagente |
| Sol | 25x, tokens baixos | 25x | 25x, mais tokens | 25x, muitos tokens | 25x, máximo de um agente | 25x, multiagente |
Os níveis disponíveis para o Spark podem variar durante o research preview.
Duas consequências práticas que surpreendem quem está começando:
- Luna Extra alto pode ser muito mais barato que Terra Baixo. Para empatar em créditos, o Luna precisaria gastar 10x mais tokens ponderados na mesma tarefa, o que raramente acontece.
- Terra Ultra pode ficar mais caro que Sol Extra alto. A tarifa do Sol é 2,5x a do Terra; se os agentes do Ultra gerarem juntos mais de 2,5x os tokens, a conta vira.
Codex Ultra: o que a delegação automática faz com seus créditos
O modo Ultra do Codex não é "um esforço acima do Max". A documentação oficial o descreve como raciocínio máximo com delegação automática de tarefas: o agente principal pode dividir o trabalho entre subagentes que executam em paralelo. Nas avaliações publicadas do GPT-5.6, o Ultra roda com 4 agentes por padrão (há configurações divulgadas com até 16), e a OpenAI é explícita na contabilização: os tokens de todos os agentes entram no consumo.
O ganho existe e é mensurável: no anúncio oficial, o Sol em modo Ultra subiu o Terminal-Bench 2.1 de 88,8 para 91,9 e o BrowseComp de 90,4 para 92,2. Mas é um ganho de poucos pontos que pode multiplicar o gasto da tarefa, então a decisão certa depende do formato do trabalho, não da dificuldade em si.
Use Ultra quando as quatro condições estiverem presentes:
- Você consegue nomear pelo menos três frentes independentes do trabalho.
- Cada frente produz resultado útil sem esperar pelas outras.
- A maior parte é leitura, exploração, teste ou comparação, não edição dos mesmos arquivos.
- Terminar mais rápido e cobrir tudo vale mais do que economizar créditos.
Prefira um agente único (Extra alto ou Max) quando:
| Sinal | Por quê |
|---|---|
| Cada etapa depende da anterior | Não há paralelismo real para explorar |
| Todos os agentes mexeriam nos mesmos arquivos | Risco de soluções concorrentes e conflito |
| Há uma única sessão autenticada no navegador | Estado compartilhado pede um responsável só |
| A causa precisa ser rastreada ponta a ponta | Dividir quebra a cadeia de evidência |
| O resultado precisa de uma única voz | Um agente central preserva coerência |
| Já existe diagnóstico e falta implementar | Ultra só adicionaria overhead |
Codex Max: a profundidade máxima de um agente só
Entre o Extra alto e o Ultra existe um nível que muita gente ainda não viu no seletor: o Max. A escala completa de profundidade funciona assim:
- Extra alto: raciocínio muito profundo de um agente.
- Max: a profundidade máxima que um único agente alcança.
- Ultra: raciocínio máximo com delegação automática para vários agentes.
Para a conta de créditos, a distinção importa: Max não tem tarifa própria. Ele custa mais porque gera muito mais tokens de raciocínio e verificação, mas o consumo continua limitado a um agente, o que o torna bem mais previsível que o Ultra. A orientação oficial é reservá-lo para os trabalhos mais difíceis em que qualidade vem antes de custo; a própria documentação lembra que a maioria das tarefas não precisa de Max nem de Ultra.
Se o problema é indivisível e muito difícil, a escalada natural é Alto, Extra alto e só então Max. Se o problema é divisível em frentes, o caminho é o Ultra. Errar essa classificação custa caro nos dois sentidos: Max em tarefa paralelizável desperdiça tempo; Ultra em tarefa linear desperdiça agentes.
A margem do Max: quando um modelo menor vence um maior
O Max cria as interseções mais interessantes da tabela de tarifas: um modelo barato raciocinando no máximo contra um modelo caro raciocinando pouco. A aritmética do rate card define a margem de cada duelo:
| Duelo | Margem do modelo menor |
|---|---|
| Terra Max contra Sol Baixo | Pode gastar até 2,5x os tokens e ainda empatar |
| Luna Max contra Terra Baixo | Pode gastar até 10x os tokens |
| Luna Max contra Sol Baixo | Pode gastar até 25x os tokens |
E não é só teoria. Nos resultados que a OpenAI publicou para o GeneBench-Pro, um benchmark difícil de análise quantitativa em biologia, o cruzamento apareceu na prática: Terra Max marcou 23,3% contra 14,4% do Sol em esforço baixo, e Luna Max marcou 16,5%, também acima do Sol em esforço baixo, gastando cerca de 21 vezes mais tokens de raciocínio. Aplicando a tarifa de saída sobre os tokens médios publicados, o Luna Max entregou resultado melhor custando aproximadamente 16% menos créditos que o Sol em esforço baixo; já o Terra Max ficou quase 4 vezes mais caro que o Sol em esforço baixo, porque sua margem é de apenas 2,5x.
A leitura correta dessas interseções:
- Luna Max brilha em tarefa fechada, textual e verificável: implementação com testes objetivos, transformação de dados com regras claras, auditoria contra checklist. A margem de 25x dá espaço enorme para raciocinar barato.
- Terra Max é o especialista em investigação profunda: um bug causal difícil, uma migração sequencial delicada, uma análise lógica extensa. Mas cuidado ao usá-lo como "Sol barato": a margem de 2,5x se esgota rápido.
- Esforço não substitui modelo onde a capacidade manda. Em navegação visual, contexto muito longo e acabamento, a distância entre os modelos é estrutural: nos números publicados pela OpenAI, o Terra mantém 89,6% em contexto de 256 a 512 mil tokens, enquanto o Luna fica em 41,3%. Nenhum Max compensa isso. Para Chrome e Computer Use, escolha o modelo antes do esforço.
Onde o Max aparece (e o que fazer quando some)
O Max tem uma particularidade operacional que gera dúvida frequente: ele pode não aparecer no seletor, dependendo do aplicativo, da versão e da configuração. A documentação orienta habilitá-lo nas configurações quando estiver ausente. O que resolve na prática:
- Habilite nas configurações do app: no aplicativo em português, o caminho é Configuração → Recursos do modelo → Esforços de raciocínio disponíveis (em inglês, Settings → Model features → Available reasoning efforts). Abra a lista e marque Máximo e Ultra; com tudo ativo, o seletor mostra "6 selecionados", como na tela abaixo. Há ainda um ajuste separado, "Ultra no slider do seletor de modelos", que exibe o Ultra como a opção mais alta do controle deslizante. Depois, encerre o aplicativo e crie uma tarefa nova, porque modelo e esforço ficam associados à tarefa atual.
2. Use o seletor avançado, não o controle resumido de potência: há relatos no repositório oficial do Codex de que o controle deslizante simplificado pula do Extra alto direto para o Ultra mesmo com o Max habilitado. O caminho confiável é Avançado → Esforço.
3. No CLI, o Max é oficial: a partir da versão 0.144.0, o comando /model exibe a sequência completa, incluindo Max entre Extra alto e Ultra.
4. Clientes diferentes, catálogos diferentes: o Codex faz parte do aplicativo desktop do ChatGPT desde julho de 2026, e as interfaces de iPhone, desktop e CLI têm ciclos de atualização próprios. É possível ver o Max no celular antes de ele aparecer no computador; a conta é a mesma, o rótulo é que varia por cliente.
Uma alternativa intermediária pouco conhecida: subagentes sob controle fora do Ultra. Em qualquer esforço, você pode pedir explicitamente "use dois subagentes, um para os logs e outro para o banco, sem alterar nada, e consolide". Nos clientes locais, dá para ir além e configurar subagentes com modelo e esforço próprios em arquivos TOML (~/.codex/agents/ ou .codex/agents/ no projeto). A recomendação oficial é usar Terra nos subagentes de exploração e leitura pesada, deixando o modelo forte só no orquestrador. Essa composição costuma sair mais barata que um Sol Ultra, porque Sol não é gasto em investigação de rotina.
Codex Spark: a cota separada (que não é Fast mode)
O GPT-5.3 Codex Spark é um caso à parte na conta de créditos. Em research preview para assinantes Pro, ele tem limites próprios que não descontam da franquia normal nem do saldo de créditos, e o rate card ainda não define tarifas ("not final"). É um modelo somente texto, com contexto de 128 mil tokens, otimizado para latência: responde a mais de 1.000 tokens por segundo.
Na prática, isso significa que alterações pequenas e interativas de código feitas no Spark são as mais baratas da sua assinatura hoje, porque saem de uma cota separada durante o preview. Só não confunda os papéis: o Spark é rápido, não é o mais capaz; para arquitetura, tarefas amplas, imagens ou navegação visual, os modelos GPT-5.6 seguem melhores.
Fast mode no Codex: o mesmo modelo com sobretaxa de 2,5x
Não confunda Spark com Fast mode: o Fast mode é o mesmo GPT-5.6, servido mais rápido, consumindo créditos a 2,5x a tarifa padrão (2x no GPT-5.4). Spark é outro modelo com outra cota; Fast mode é o mesmo modelo com sobretaxa de velocidade.
As comparações que importam
Luna Extra alto vs Terra Baixo vs Terra Médio
A condição de empate é objetiva: Luna Extra alto só custa o mesmo que Terra se gastar 10x mais tokens ponderados. Por isso:
| Prioridade | Escolha |
|---|---|
| Menor custo por tarefa | Luna Extra alto |
| Melhor equilíbrio geral | Terra Médio |
| Menor latência no modelo Terra | Terra Baixo |
Terra Baixo é a configuração mais difícil de justificar: para economizar, Luna Extra alto ganha; para confiar, Terra Médio ganha. Use-o quando quiser especificamente o Terra com a menor espera possível.
Terra Ultra vs Sol Alto e Extra alto
Terra Ultra não é "um Sol mais barato". Ele compra cobertura e paralelismo (auditorias de muitos módulos, pesquisa em muitas fontes, testes em vários ambientes). Sol Alto e Extra alto compram julgamento e profundidade (o bug difícil, a decisão de arquitetura, o fluxo delicado no navegador). Para uma tarefa linear difícil, Sol Alto tende a vencer o Terra Ultra em qualidade e em custo, porque evita a multiplicação de agentes.
Sol Alto vs Sol Extra alto vs Sol Max vs Sol Ultra
Mesma tarifa, consumos muito diferentes:
| Configuração | Quando usar | Eficiência |
|---|---|---|
| Sol Alto | Padrão para trabalho difícil: bugs complexos, arquitetura, análise, navegador | Melhor da família Sol |
| Sol Extra alto | Quando o Alto falhou ou o custo de errar supera o custo de raciocinar mais | Boa em problemas críticos |
| Sol Max | O problema mais difícil da fila, indivisível, em que qualidade vem antes de custo | Cara, mas previsível: um agente só |
| Sol Ultra | Só para trabalho grande e divisível em frentes independentes | Baixa em tarefas lineares |
Para "melhorar um pouco" uma resposta única, Ultra é a pior escolha da tabela: paga vários agentes para um problema de um agente só. Entre Sol Max e Sol Ultra, a pergunta decisiva não é "quão difícil", e sim "quantas frentes independentes".
Matriz por tipo de trabalho
A matriz abaixo parte do custo: é o menor gasto de créditos que costuma resolver cada tipo de tarefa. Para escolher pela capacidade do modelo, use o guia de Sol, Terra e Luna.
| Tarefa | Configuração recomendada |
|---|---|
| Alterações rápidas enquanto programa | Spark (cota separada durante o preview) |
| Bug pequeno e localizado | Spark ou Luna Alto |
| Implementação clara e delimitada | Luna Extra alto |
| Código bem especificado, com testes objetivos | Luna Max |
| Desenvolvimento cotidiano em repositório | Terra Médio |
| Refatoração ou debugging complexo | Sol Alto |
| Investigação causal profunda com evidências fechadas | Terra Max |
| Arquitetura e problemas críticos | Sol Extra alto ou Max |
| Auditoria de muitos módulos | Terra Ultra |
| Reescrita e texto curto | Luna Baixo ou Médio |
| Documento executivo importante | Sol Alto |
| Pesquisa em muitas fontes paralelas | Terra Ultra |
| Automação repetitiva no navegador | Luna ou Terra Médio |
| Fluxo visual importante no Chrome | Sol Alto |
| Fluxo longo e frágil, com recuperação de erros | Sol Extra alto |
No uso de computador e navegador, vale um alerta de custo indireto: os benchmarks oficiais mostram uma distância entre os modelos muito maior em OSWorld 2.0 (Sol 62,6 contra 45,6 do Luna) do que em programação (SWE-Bench Pro: 64,6 contra 62,7). Um modelo barato que erra a navegação gera novas capturas, novas tentativas e mais chamadas: a economia por token pode ser anulada pela repetição do fluxo.
Três fluxos que gastam menos que um Ultra contínuo
Os maiores desperdícios acontecem quando uma configuração cara fica ligada do início ao fim. Fluxos em etapas resolvem:
- Explorar amplo, decidir fundo: Terra Ultra para coletar evidências em paralelo (auditoria, pesquisa, comparação); depois Sol Extra alto para a decisão, o diagnóstico ou o documento final com uma única voz.
- Planejar, executar em paralelo, integrar: Sol Extra alto define arquitetura, contratos e critérios de aceite; Terra Ultra executa as frentes já especificadas; Sol Extra alto integra e valida no final.
- Investigar em paralelo, corrigir centralizado: em um incidente, agentes em modo leitura varrem logs, banco, API e deploy ao mesmo tempo; um único Sol Extra alto escolhe a hipótese, aplica o patch e roda a regressão.
A lógica dos três é a mesma: paralelize a leitura, centralize a escrita e reserve o modelo caro para as decisões.
Checklist de 30 segundos antes de rodar
- A tarefa é interativa e pequena? Spark.
- É simples e bem especificada? Luna, subindo o esforço se houver ambiguidade.
- É trabalho normal de produção? Terra Médio.
- É difícil, crítica ou ambígua? Sol Alto, e Extra alto se o erro custar caro.
- É um problema único, fechado e verificável? Um modelo menor em Max pode vencer um maior em esforço baixo.
- Tem três ou mais frentes independentes? Considere Ultra, no menor modelo que dá conta de cada frente.
- Vai reusar muito contexto? Mantenha a mesma sessão para aproveitar o cache a 1/10 do preço.
- Precisa só de velocidade? Lembre que Fast mode custa 2,5x; muitas vezes Terra comum resolve.
Perguntas frequentes sobre créditos do Codex
Quanto custa uma tarefa no Codex?
Segundo a OpenAI, uma mensagem típica com GPT-5.6 consome entre 5 e 40 créditos, variando com modelo, esforço de raciocínio e tamanho do contexto. Uma tarefa completa pode somar várias mensagens, e execuções com Ultra passam disso; o valor exato da sua conta aparece em Configurações do Codex, na aba Uso.
Onde vejo quanto estou gastando?
Em Configurações do Codex → Uso (chatgpt.com/codex/settings/usage), que mostra a franquia do plano, o consumo recente e o saldo de créditos comprados.
Subir o esforço de raciocínio dobra o custo?
Não existe multiplicador fixo. O esforço aumenta os tokens de raciocínio, cobrados como saída na tarifa do modelo. O aumento real varia por tarefa; em instruções claras e determinísticas, pode ser quase nulo o ganho e alto o custo extra.
O Ultra custa quantas vezes mais?
Não há multiplicador publicado. O Ultra roda raciocínio máximo e pode delegar a subagentes (4 por padrão nas avaliações oficiais), e todos os tokens contam. Em tarefa paralelizável, o custo extra compra tempo e cobertura; em tarefa linear, é desperdício.
Max e Ultra custam o mesmo?
Nenhum dos dois tem tarifa própria; os dois pagam a tarifa do modelo pelos tokens gerados. A diferença está no formato do consumo: o Max é o raciocínio mais profundo de um único agente, então o gasto cresce, mas de forma limitada e previsível. O Ultra soma os tokens de vários agentes, e o total varia muito com a tarefa.
O Max não aparece no meu seletor. E agora?
Habilite-o em Configuração → Recursos do modelo → Esforços de raciocínio disponíveis, marcando Máximo (e Ultra, se quiser) na lista, e crie uma tarefa nova. Se o controle resumido de potência continuar pulando do Extra alto para o Ultra, use o seletor avançado de esforço; no CLI, o /model mostra o Max a partir da versão 0.144.0. Interfaces de celular, desktop e CLI atualizam em ritmos diferentes, então o nível pode aparecer em um cliente antes do outro.
Luna com esforço alto sai mais caro que Terra com esforço baixo?
Quase nunca. A tarifa do Terra é 10x a do Luna, então o Luna precisaria gastar 10x mais tokens ponderados para empatar. Se a tarefa está bem especificada, Luna Extra alto costuma ser a opção mais econômica do seletor.
O Spark consome meus créditos?
Durante o research preview, não: ele tem limites próprios, separados da franquia e do saldo, e o rate card ainda não define tarifa. Isso pode mudar quando sair do preview; confira o rate card.
Fast mode e Spark são a mesma coisa?
Não. Fast mode é o GPT-5.6 servido mais rápido a 2,5x a tarifa. Spark é outro modelo (GPT-5.3 Codex Spark), somente texto e de baixa latência, com cota separada no preview.
Créditos comprados expiram?
Sim, em 12 meses, e não são reembolsáveis nem transferíveis. O mesmo pool de créditos é compartilhado com outros recursos agênticos da conta, como o ChatGPT Work.
Os preços de 30 de julho de 2026 mudaram as proporções?
O corte anunciado reduziu Terra em 20% e Luna em 80% na API, com reflexo no consumo das assinaturas, e manteve o Sol. As proporções do rate card vigente na revisão deste artigo eram 25x, 10x e 1x; confirme os valores atuais no rate card oficial antes de fazer contas finas.
Cache realmente economiza?
Sim: ler entrada cacheada custa 1/10 da entrada normal. Na API, os modelos GPT-5.6 cobram a gravação do cache a 1,25x a entrada, então o ganho líquido vem do reaproveitamento: trabalhar na mesma sessão, em vez de abrir conversas novas com o mesmo contexto, é uma das economias mais fáceis de capturar.
Conclusão
Créditos do Codex não se economizam escolhendo "o modelo mais fraco", e sim alinhando as três alavancas ao formato da tarefa: tarifa (modelo), tokens (esforço) e arquitetura de execução (agente único ou Ultra). O padrão que emerge das tabelas é simples: Spark para o interativo, Luna para o delimitado, Terra Médio como base, Sol Alto para o que importa, Extra alto para o crítico, Max para o problema indivisível mais difícil da fila e Ultra apenas quando você consegue nomear as frentes que os subagentes vão executar. E vale lembrar a interseção mais lucrativa do rate card: um modelo menor em Max, com margem de 10x ou 25x para raciocinar, pode entregar mais barato o que um modelo maior faria em esforço baixo.
Para escolher o modelo pela capacidade, consulte o guia de Sol, Terra e Luna. Para organizar o processo inteiro da assinatura, veja como aproveitar melhor ChatGPT e Codex sem gastar mais. E se a sua empresa está estruturando agentes de IA em produção, essa mesma disciplina de custo por token vale para qualquer provedor.
Quer colocar IA para trabalhar com custo sob controle?
A X-Apps desenha fluxos de IA para empresas com governança de custo desde o primeiro dia: escolha de modelos, roteamento por tarefa, caching, observabilidade de consumo e agentes em produção.
Quer usar IA com custo previsível?
Solicite um orçamento para estruturar seus fluxos de IA com governança de consumo, roteamento de modelos e resultados mensuráveis.
Fontes oficiais e documentação
- Codex rate card - OpenAI Help Center
- Using credits for flexible usage in ChatGPT - OpenAI Help Center
- Using Codex with your ChatGPT plan - OpenAI Help Center
- Codex pricing - Codex Docs
- Models - ChatGPT Learn
- Subagents - ChatGPT Learn
- Reasoning guide - OpenAI API
- GPT-5.6 announcement - OpenAI
- Advancing the price-performance frontier with GPT-5.6 - OpenAI
- Introducing GPT-5.3-Codex-Spark - OpenAI
- GPT-5.6 in ChatGPT - OpenAI Help Center