Montar SquadSolicitar Orçamento
Negócios31 de agosto de 202610 min de leituraAtualizado em 6 de setembro de 2026

Ata de reunião com IA: quanto custa em 10 mil reuniões por mês

O custo por reunião em cada nível de raciocínio, oito arquiteturas comparadas e a política que reserva o raciocínio caro para negociação, jurídico e contradição.

Índice do artigo
faltam 10 min de leitura

Uma reunião de duas horas com seis pessoas produz umas 18 mil palavras de transcrição, e dentro delas estão três decisões, sete tarefas com dono, dois riscos, uma mudança de escopo e um compromisso comercial que ninguém anotou. O trabalho de tirar isso dali e colocar no CRM é caro quando é humano, e virou barato quando é máquina. A pergunta que ficou é quanto exatamente, e o que muda quando você pede para a máquina pensar mais.

Este artigo responde a segunda parte. A conta genérica do botão de raciocínio está em a conta do reasoning effort; aqui ela é aplicada a um pipeline de reuniões, com o preço de tabela do GPT-5.6 Sol, oito arquiteturas comparadas e a projeção de 10 até 100 mil reuniões.

Resumo do artigo

  • Uma reunião de uma hora custa entre US$ 0,20 e US$ 1,66 para ser processada, dependendo só do nível de raciocínio escolhido.
  • A leitura da transcrição responde por 3% a 29% da conta. O resto é o modelo pensando, cobrado a US$ 20 por milhão de tokens.
  • A 10 mil reuniões por mês, trocar raciocínio alto por médio devolve US$ 25,9 mil por ano; subir para máximo cobra US$ 141 mil a mais.
  • Dividir a transcrição em pedaços saiu 31% mais caro que ler tudo de uma vez, e ainda quebra as referências que atravessam a reunião.

O que esse pipeline precisa extrair, e por que não é resumo

Resumo e extração são tarefas diferentes, e confundir as duas é o erro que faz o projeto nascer torto. Resumo comprime e pode escolher o que descartar. Extração precisa achar tudo e não pode inventar nada, porque cada campo vira uma ação em outro sistema.

  • DecisõesO que foi decidido, separado do que foi apenas sugerido.
  • Tarefas e donosQuem assumiu, com prazo, e não quem foi mencionado.
  • CompromissosO que foi prometido a um cliente, com o valor dito em voz alta.
  • Mudança de escopoPedido novo separado de requisito que já existia.
  • Riscos e objeçõesO que travou, quem travou e o que resolveria.
  • DependênciasO que espera o quê, e de quem.
  • PendênciasO que ficou sem dono ao fim da conversa.
  • Estrutura de CRMCampos prontos para atualizar negócio e contato.

A métrica que importa é recall com fidelidade: encontrar todos os itens e não acrescentar nenhum. Eloquência não conta. Um resumo bonito que perdeu uma tarefa é pior que uma lista seca que achou todas, porque o erro é silencioso e vira uma entrega não feita três semanas depois.

Reasoning effort importa para organizar reuniões?

A resposta curta é que ele importa muito menos do que a intuição sugere, e a evidência pública disponível aponta na direção contrária ao senso comum.

As dificuldades reais de uma ata são de leitura, não de dedução: achar um fato dito no minuto 12 e retomado no minuto 96, resolver a quem se refere "aquele cliente", distinguir quem assumiu um compromisso de quem só concordou, perceber que a decisão do início foi contradita no fim. É tentador achar que isso pede mais deliberação. O que os dados mostram é que pede mais atenção ao documento, e isso não é a mesma coisa.

A medição mais próxima do caso vem da Observe.ai, que testou níveis de esforço em tarefas sobre transcrições de chamada. Em extração de entidades, subir de baixo para médio mudou o resultado de 87,5% para 87,6%. Em geração abstrativa, o nível alto ficou em 89,0% contra 90,5% do baixo. Só a sumarização subiu de forma consistente, de 94,6% para 96,1%, ao custo de a latência ir de 2 ou 3 segundos para 32,6 segundos.

A literatura reforça. Um estudo de 2025 comparou oito estratégias de raciocínio e três modelos de raciocínio em oito conjuntos de dados de sumarização e concluiu que aumentar o orçamento interno de raciocínio não melhora a sumarização de forma confiável e pode reduzir a consistência factual, com a fidelidade caindo conforme a capacidade de raciocínio aumenta.

A hipótese contrária tem mais evidência a favor

A hipótese de que recuperação em contexto longo e estrutura de prompt pesam mais que effort, para essa tarefa, é a que se sustenta melhor nos dados públicos.

O GPT-5.6 Sol marca 91,5% no MRCR, o teste de recuperação em contexto longo reportado pela OpenAI, e a janela é de 1,05 milhão de tokens. Uma reunião de três horas ocupa cerca de 36 mil tokens. Ou seja, a tarefa inteira cabe com folga de mais de vinte e cinco vezes, e o gargalo de encontrar o fato disperso é uma questão de recuperação, que já está resolvida em nível alto, e não de deliberação, que é o que o effort compra.

Ilustração isométrica comparando um lanterna varrendo um documento longo e uma engrenagem girando sobre um único parágrafo

Existe ainda um efeito perverso documentado: em tarefas ancoradas em um documento, mais deliberação abre espaço para o modelo elaborar além do que está na fonte. Em uma ata, elaborar é exatamente o defeito, porque uma inferência plausível vira uma tarefa que ninguém pediu dentro do HubSpot.

O que muda o resultado de verdade nessas tarefas é o esquema de saída, a instrução de citar o trecho de origem de cada item e a separação explícita entre o que foi decidido e o que foi cogitado.

Onde o effort ainda paga, aqui, é em um subconjunto pequeno e identificável: contradições entre momentos distantes da reunião, negociação com valores e condições, e trechos jurídicos ou de arquitetura em que a consequência de errar é alta. Guarde essa lista, porque é dela que sai a política do fim do artigo.

Você não paga pela transcrição, paga pelo pensamento

Esta é a inversão que muda o desenho do sistema. Ler o documento é barato; pensar sobre ele é caro. O input custa US$ 4 por milhão e o raciocínio é cobrado como output, a US$ 20 por milhão.

Transcrição de 1h, 12 mil tokens Leitura: US$ 0,049 Raciocínio e resposta em high: US$ 0,485 US$ 0,534 por reunião
Na configuração high, a leitura do documento é 9,1% da conta.

Em uma reunião de três horas processada em max, a transcrição inteira responde por 3,7% do custo. Os outros 96,3% são o modelo pensando. Quanto mais barato o effort, mais a transcrição pesa: em low, ela chega a 29% da conta de uma reunião de três horas.

Isso tem duas consequências de projeto. A primeira é que otimizar o tamanho da transcrição rende pouco enquanto o effort estiver alto, porque você está cortando a menor parcela. A segunda é que o cache muda de papel: como cada transcrição é única e nunca se repete entre reuniões, ela não gera reaproveitamento em pipeline de uma passagem só. Já em arquitetura de duas passagens, a segunda leitura sai por um décimo do preço.

Quanto custa uma reunião em cada nível

Effort30 min1 hora2 horas3 horas
noneUS$ 0,061US$ 0,109US$ 0,197US$ 0,285
lowUS$ 0,116US$ 0,201US$ 0,351US$ 0,500
mediumUS$ 0,191US$ 0,326US$ 0,559US$ 0,792
highUS$ 0,316US$ 0,534US$ 0,905US$ 1,276
xhighUS$ 0,509US$ 0,856US$ 1,443US$ 2,029
maxUS$ 0,994US$ 1,664US$ 2,789US$ 3,914

Cálculo próprio com o preço de tabela do gpt-5.6-sol em 31/08/2026. Premissas: 12 mil tokens de transcrição por hora com diarização, 2 mil tokens de prompt e esquema, e saída visível de 1.800 a 7.000 tokens conforme a duração. A proporção entre raciocínio e resposta visível por nível foi derivada dos tokens de output publicados pelo Artificial Analysis.

Duas células dessa tabela vêm com uma ressalva que é, ela mesma, um argumento contra o nível máximo. Nas reuniões de duas e de três horas, o modelo projeta para max mais tokens de saída do que os 128 mil que o Sol consegue emitir em uma única resposta, o que na prática significa chamada truncada. O nível máximo em transcrição longa não é só caro, é frágil, e aqueles dois números devem ser lidos como teto teórico e não como fatura.

A premissa mais forte desse modelo é a intensidade de raciocínio na tarefa de extração, derivada de um benchmark de problemas difíceis. Testamos o que acontece se ela estiver bem menor: variando os tokens por hora de transcrição entre 8 mil e 20 mil e cortando a intensidade de raciocínio pela metade, o degrau de medium para high fica entre 41% e 67% de custo adicional nos seis cenários. A conclusão qualitativa sobrevive à premissa.

Oito arquiteturas, uma conta

Comparando o custo de processar a mesma reunião de uma hora por caminhos diferentes:

Low, lê tudo uma vezUS$ 0,201
Low + auditoria high só nos ambíguosUS$ 0,253
Classificador barato roteia 25% para highUS$ 0,287
Medium, lê tudo uma vezUS$ 0,326
Low extrai + high audita tudoUS$ 0,414
Duas passagens mediumUS$ 0,483
High, lê tudo uma vezUS$ 0,534
Chunking + consolidação highUS$ 0,701
Custo por reunião de uma hora, por arquitetura. A opção destacada concentra o raciocínio caro só onde ele muda a decisão.

Três resultados merecem atenção. O primeiro é que o chunking determinístico, herdado da época em que a janela de contexto era pequena, hoje custa 31% a mais que simplesmente ler tudo de uma vez, porque você paga o raciocínio uma vez por pedaço. E ele ainda destrói justamente a informação que o caso precisa: uma referência dita no primeiro terço e resolvida no último não sobrevive ao corte.

Ilustração isométrica de uma faixa de transcrição cortada em quatro pedaços, com uma linha de ligação entre o primeiro e o último pedaço rompida no corte

O corte é o problema. Uma pessoa diz "fechamos com aquele cliente do contrato antigo" no minuto 8 e o nome só aparece no minuto 94. Nenhum dos dois pedaços contém a informação inteira, e a consolidação recebe dois fragmentos que já perderam a ligação.

O segundo é que auditar sai barato. A segunda passagem relê a transcrição do cache por um décimo do preço do input, então uma arquitetura de extração barata com auditoria em raciocínio alto sobre todos os itens custa US$ 0,414, ainda 22% abaixo de simplesmente rodar tudo em high.

O terceiro é que a auditoria seletiva domina. Extrair barato em todas as reuniões e escalar para high só nos itens ambíguos custa US$ 0,253, menos da metade de high, e coloca o raciocínio caro exatamente nos pontos que a evidência indica que se beneficiam dele.

De 10 a 100 mil reuniões

Com um mix de 40% de reuniões de 30 minutos, 35% de uma hora, 20% de duas e 5% de três horas, o custo médio por reunião e a projeção anual:

ConfiguraçãoCusto médio1.000/mês, ao ano10.000/mês, ao ano100.000/mês, ao ano
lowUS$ 0,212US$ 2.545US$ 25.452US$ 254.515
Auditoria seletivaUS$ 0,267US$ 3.205US$ 32.052US$ 320.516
mediumUS$ 0,342US$ 4.103US$ 41.027US$ 410.266
highUS$ 0,558US$ 6.694US$ 66.935US$ 669.350
xhighUS$ 0,894US$ 10.722US$ 107.220US$ 1.072.205
maxUS$ 1,733US$ 20.801US$ 208.009US$ 2.080.090

Cálculo próprio, mesmas premissas da tabela anterior, com preço de tabela de 31/08/2026. Volumes de 10 e 100 reuniões por mês foram omitidos por serem irrelevantes na decisão: nessa faixa a diferença entre o nível mais barato e o mais caro é de poucos dólares por mês, e o critério deve ser qualidade, não custo.

A leitura operacional é essa. Abaixo de umas centenas de reuniões por mês, a discussão de effort é perda de tempo: use o nível que der o melhor resultado, porque a diferença anual cabe em um almoço. A partir de alguns milhares, ela vira uma linha de orçamento: a 10 mil reuniões por mês, trocar high por medium devolve US$ 25,9 mil por ano, e a auditoria seletiva devolve US$ 34,9 mil mantendo raciocínio alto onde ele importa. Subir de high para max cobra US$ 141 mil adicionais por ano.

Duas alavancas de fora do effort valem mais do que parecem nessa faixa. O modo batch cobra metade do preço de tabela, e um pipeline de atas é assíncrono por natureza, o que o torna candidato natural. E processar a transcrição uma única vez, em vez de reprocessá-la a cada nova pergunta do time, é a diferença entre pagar o input uma vez e pagá-lo indefinidamente.

A política adaptativa que sai dos dados

A política abaixo não parte da premissa de que médio é o melhor. Ela parte de duas conclusões da apuração: extração ancorada em documento satura cedo, e o raciocínio caro rende onde existe conflito, valor ou consequência jurídica.

Todas as reuniões, extração estruturada em low, com esquema rígido e citação do trecho de origem por item
Classificador barato, marca negociação, jurídico, arquitetura, conflito, valor financeiro e mudança de escopo
Reunião operacional sem marca, segue direto para o CRM
Reunião marcada, segunda passagem em high lendo a transcrição do cache
Auditor de contradição, compara itens distantes e sinaliza divergência entre decisão e retomada
Divergência encontrada, escala para revisão humana com os dois trechos lado a lado
O raciocínio caro entra por exceção, não por padrão, e a saída duvidosa vai para pessoa, não para um nível mais alto de modelo.
Ilustração isométrica de um funil: muitas reuniões entram por uma via barata, poucas descem para uma segunda etapa marcada, e um punhado chega a uma mesa com uma pessoa
O raciocínio caro deixa de ser o padrão e passa a ser exceção, e a exceção da exceção vai para uma pessoa.

O ponto que costuma ser esquecido é o último. Quando o auditor encontra uma contradição real, subir o effort não é a resposta certa, porque o modelo não tem como saber qual das duas falas prevaleceu se a reunião não deixou isso claro. Essa é uma escalada para humano, e desenhar o sistema para isso custa menos do que pagar max em todas as reuniões esperando que ele adivinhe.

Fontes, método e limitações

Apuração de 31/08/2026. Preço, regras de cache, contabilidade de reasoning tokens e janela de contexto vêm da documentação oficial da OpenAI. Os tokens de output por nível de effort, usados para derivar a proporção entre raciocínio e resposta visível, vêm do Artificial Analysis Intelligence Index v4.1.1. A evidência sobre extração e sumarização vem da avaliação da Observe.ai com o GPT-5 e do estudo de Yuan e Zhang sobre raciocínio em sumarização abstrativa, ambos rotulados no texto como indiretos.

Todos os custos deste artigo são cálculo próprio sobre um modelo com premissas declaradas, não medições de um pipeline em produção. As três premissas que mais influenciam o resultado são o volume de tokens por hora de transcrição, o tamanho da saída estruturada e a intensidade de raciocínio da tarefa de extração. A última é a mais frágil, porque foi derivada de um benchmark de problemas difíceis e aplicada a uma tarefa de extração; a análise de sensibilidade da seção de custos mostra que a conclusão sobre o degrau de médio para alto se mantém mesmo cortando essa premissa pela metade.

Não há evidência pública que compare níveis de reasoning effort do GPT-5.6 Sol especificamente em extração de atas de reunião. Qualquer equipe que rode esse pipeline em volume tem, no próprio usage, um conjunto de dados melhor do que qualquer benchmark público para essa decisão.

Perguntas frequentes

Pelo modelo deste artigo, com o GPT-5.6 Sol a preço de tabela, entre US$ 0,20 em raciocínio baixo e US$ 1,66 em raciocínio máximo. A leitura da transcrição responde por menos de 10% disso na maioria das configurações.

Post anterior
Ata gerada por IA: como medir o que ela omitiu
Próximo post
Você provavelmente não precisa de banco vetorial
Newsletter

Um e-mail por mês, sem ruído

O que aprendemos entregando software sob medida e IA aplicada.

Artigos similares

Ata gerada por IA: como medir o que ela omitiu8 min · Negócios
Como transformar sua empresa em uma organização exponencial3 min · Negócios
Cuidados ao validar um projeto de desenvolvimento de software2 min · Negócios
Escopo aberto e fechado: Os softwares e a urgência das inovações1 min · Negócios
Guia básico de APIs para empresas3 min · Negócios

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English