Montar SquadSolicitar Orçamento
Tecnologia4 de agosto de 202614 min de leituraAtualizado em 6 de setembro de 2026

Agentes que usam o computador: o que o benchmark OSWorld 2.0 mostra

Entenda como o OSWorld 2 avalia 108 fluxos profissionais, separa conclusão binária de progresso parcial e como ler os 70,57% do Claude Opus 5.

Índice do artigo
faltam 14 min de leitura

Os agentes de IA já conseguem abrir aplicativos, ler e-mails, consultar documentos, preencher formulários e tomar algumas decisões. O problema é que fazer partes de um processo não é o mesmo que entregar o processo inteiro.

O OSWorld 2.0, nome também divulgado como OSWorld 2, foi criado para medir essa diferença. Em vez de pedir uma ação curta, o benchmark reúne fluxos profissionais que atravessam aplicações, arquivos, mensagens, regras e decisões ao longo de centenas de passos.

A principal conclusão não é que os agentes “falham em 79,4% de tudo”. É que a distância entre progresso parcial e conclusão confiável ainda é grande, e essa distância precisa orientar arquitetura, custo, segurança e supervisão humana.

Time de engenharia e IA aplicada, X-Apps

Resumo do artigo

  • O OSWorld 2 reúne 108 tarefas profissionais longas: a mediana exige cerca de 1,6 hora de trabalho humano e os agentes executam, em média, 318 ações por tentativa.
  • O melhor resultado oficial publicado combina 54,8% de pontuação parcial com apenas 20,6% de conclusão binária, e é essa distância que separa demonstração de produção.
  • A Anthropic reporta 70,57% de Pass@1 para o Claude Opus 5 em protocolo próprio, número que não é comparável ao ranking oficial sem reproduzir as mesmas condições.
  • Na faixa de tarefas mais longas, entre 163 e 360 minutos, todos os modelos exibidos no paper ficaram em 0% de conclusão binária.

Resumo executivo

20,6%Melhor conclusão binária oficial
54,8%Pontuação parcial da mesma configuração
1,6 hDuração mediana para um humano
318Ações médias por tentativa
IndicadorO que o número realmente significa
108 tarefasConjunto do OSWorld 2 com fluxos profissionais longos e realistas.
1,6 horaDuração mediana para uma pessoa qualificada concluir uma tarefa.
318 açõesMédia de chamadas de ferramenta dos agentes avaliados, contra aproximadamente 30 no OSWorld original.
20,6%Melhor conclusão binária publicada no paper e no leaderboard oficial: Claude Opus 4.8, em configuração max e execução em lote.
54,8%Pontuação parcial da mesma configuração: houve bastante progresso, mas nem sempre entrega completa.
70,57%Pass@1 reportado pela Anthropic para Claude Opus 5, em protocolo próprio descrito no System Card.
Opus 5 no ranking oficialNa data desta atualização, o modelo não aparece no leaderboard público mantido pelo projeto; portanto, sua pontuação binária oficial independente permanece não publicada.

Esses números respondem a perguntas diferentes. Misturá-los em um único ranking cria uma conclusão atraente, mas metodologicamente incorreta.

O que é o OSWorld 2.0

O OSWorld 2 avalia agentes que controlam um computador em ambientes com navegador, e-mail, planilhas, documentos, sistemas empresariais, arquivos e aplicações multimídia. O paper oficial descreve três princípios centrais:

  • fluxos autênticos: as tarefas são inspiradas em trabalho profissional real;
  • horizonte longo: o agente precisa sustentar contexto, estado e restrições por centenas de ações;
  • avaliação verificável: cada tarefa possui checkpoints objetivos que permitem medir tanto o resultado final quanto o progresso intermediário.

Anatomia de uma tarefa do OSWorld 2: 108 tarefas, 1,6 hora de duração mediana, 318 ações em média e limite de 500 passos

Quase 70% das tarefas exigem mais de uma hora de trabalho humano. Os agentes usam, em média, 318 chamadas de ferramenta, e o protocolo principal permite até 500 passos. Isso muda a natureza do teste: o desafio deixa de ser “encontrar o botão certo” e passa a ser “preservar a intenção do usuário durante um processo inteiro”.

OSWorld, OSWorld-Verified e OSWorld 2.0: não confunda

Os três nomes pertencem à mesma família, mas não representam a mesma dificuldade.

BenchmarkFocoHorizonte típicoComo interpretar
OSWorldUso geral de aplicações reais em diferentes sistemas operacionais.Tarefas relativamente curtas, com cerca de 30 ações dos agentes no comparativo apresentado pelo novo paper.Mede capacidade de percepção e operação em interfaces.
OSWorld-VerifiedVersão revisada do conjunto anterior para reduzir tarefas e avaliações problemáticas.Ações mais curtas e autocontidas, raramente atravessando mais de uma ou duas aplicações.É melhor para comparar competência em tarefas delimitadas.
OSWorld 2Fluxos profissionais conectados, com múltiplas fontes, aplicações, mudanças de estado e decisões.Mediana humana de 1,6 hora e média de 318 ações dos agentes.Mede resistência a erros acumulados e capacidade de finalizar trabalho de ponta a ponta.

O próprio paper usa um contraste importante: Claude Opus 4.8 chega a 83,5% no OSWorld-Verified, mas a 20,6% de conclusão binária no OSWorld 2. Não há contradição. A segunda avaliação mede um horizonte muito mais longo, no qual pequenos desvios se acumulam.

Como ler conclusão binária, progresso parcial e Pass@1

Conclusão binária

A métrica binária responde à pergunta mais exigente: o agente concluiu todo o trabalho?

Se uma prestação de contas exige cinco despesas corretas, anexos, centro de custo, aprovação e envio final, deixar uma etapa crítica errada resulta em zero na conclusão binária, mesmo que boa parte do processo tenha sido feita.

Essa é a métrica mais próxima de uma entrega empresarial utilizável, embora ainda não inclua todos os riscos de produção.

Pontuação parcial

O OSWorld 2 divide cada tarefa em checkpoints objetivos, em média 27,25 checkpoints por tarefa. A pontuação parcial mede quantos desses requisitos foram cumpridos.

OSWorld 2 · tarefa média318 ações, 1,6 hora de execução
20,6% conclusão binária 54,8% pontuação parcial
ação 1ação 159ação 318
A mesma execução lida por duas métricas: quanto do caminho foi percorrido e quantas tarefas chegaram ao estado final. Dados do Claude Opus 4.8 em configuração max, paper do OSWorld 2.

Pontuação parcial alta mostra que o agente avançou e pode ter economizado trabalho. Ela não autoriza dizer que o processo foi concluído. Em produção, esse progresso pode ser útil quando um humano revisa e finaliza; pode ser perigoso quando a automação publica, paga, apaga ou envia algo sem validação.

Pass@1

Pass@1 normalmente representa a chance de sucesso em uma tentativa, sob um protocolo específico. No System Card do Claude Opus 5, a Anthropic descreve o resultado como taxa de sucesso na primeira tentativa, calculada como média de cinco execuções.

O nome da métrica, o ambiente, a resolução, o limite de passos, o avaliador e o sistema que cerca o modelo precisam acompanhar o número. Por isso, 70,57% de Pass@1 não deve ser renomeado como 70,57% de pontuação parcial e também não deve ser colocado na mesma coluna dos 20,6% binários sem uma reprodução comparável.

Resultados oficiais do paper e do leaderboard

Esta é a comparação publicada para as três melhores configurações em lote do paper. O custo representa a média aproximada por tarefa avaliada, não o custo de uma conclusão garantida.

Modelo e configuraçãoConclusão bináriaPontuação parcialCusto médio por tarefa
Claude Opus 4.8, max, em lote20,6%54,8%US$ 72,40
Claude Opus 4.7, max, em lote18,2%48,91%US$ 33,60
GPT-5.5, xhigh, em lote13,0%49,5%US$ 25,50

Fonte: paper do OSWorld 2 e leaderboard mantido pelo projeto. A linha destacada é a melhor conclusão binária publicada.

O valor mais útil é a diferença entre as duas colunas de desempenho. No Opus 4.8, por exemplo, 54,8% de progresso parcial coexistem com 20,6% de conclusão integral. O modelo frequentemente faz partes corretas, mas ainda perde detalhes, deixa requisitos para trás ou não verifica o estado final.

Atualização: como interpretar os 70,57% do Claude Opus 5

A página de lançamento do Claude Opus 5 afirma que o modelo supera os demais no OSWorld 2 considerando desempenho e custo. O documento técnico oferece o contexto necessário para interpretar a afirmação.

No System Card do Claude Opus 5, a Anthropic informa:

  • execução nas configurações padrão dos modelos;
  • resolução de 1080p;
  • limite de 500 ações por tarefa;
  • uso de Claude Opus 4.8 como avaliador por modelo quando necessário;
  • resultado agregado em cinco execuções;
  • métrica apresentada como Pass@1 accuracy e taxa de sucesso na primeira tentativa.
Modelo no gráfico da AnthropicPass@1 reportado
Claude Opus 570,6% (70,57% no texto técnico)
Claude Fable 566,1%
GPT-5.6 Sol62,6%
Claude Opus 4.855,7%
Claude Sonnet 551,4%
Muse Spark 1.147,3%

O resultado é relevante e indica avanço. Mas há três limites editoriais importantes:

  1. o gráfico é uma avaliação publicada pela própria Anthropic, não uma entrada do leaderboard independente mantido pelos autores do OSWorld 2;
  2. a métrica está identificada como Pass@1, não como pontuação parcial;
  3. o Opus 5 ainda não aparece no ranking público oficial na data desta atualização.

Portanto, a formulação responsável é: a Anthropic reporta 70,57% de Pass@1 para o Claude Opus 5 em seu protocolo do OSWorld 2. A formulação “o Opus 5 conclui sete de cada dez tarefas do ranking oficial” vai além da evidência disponível.

Um fluxo completo: o reembolso no ExpenseFlow

Uma das trajetórias descritas no paper ajuda a entender por que o benchmark é difícil. O agente precisa preparar um relatório de despesas no sistema fictício ExpenseFlow, e a sequência abaixo mostra por que o percentual parcial fica alto enquanto a conclusão não vem.

  1. Leitura das regras
    Consulta um tutorial e uma política em PDF

    Entende o formato exigido antes de tocar no sistema. É a parte que qualquer demonstração mostra bem.

  2. Coleta
    Localiza recibos no e-mail e dados em um relatório anterior

    Recupera comprovantes, dados pessoais e o centro de custo espalhados por aplicações diferentes.

  3. Reconciliação
    Confere transações no banco e cruza as referências

    Reconcilia datas, valores, categorias e códigos contábeis entre fontes que não conversam entre si.

  4. Preenchimento
    Monta cinco linhas de despesa e anexa comprovantes

    Distribui valores, seleciona o aprovador e liga cada anexo à linha correspondente.

  5. Ponto de quebra
    Aparecem informações novas e inconsistências

    É aqui que o agente deveria interromper e perguntar ao usuário. Quando ele escolhe uma interpretação em vez de pedir esclarecimento, tudo que vem depois opera sobre uma premissa errada.

  6. Avaliação final 492 ações
    Relatório enviado, com pontuação parcial de 0,76

    Houve entrega visível, mas permaneceram discrepâncias em localização de diária e anexos. O sistema chegou longe e ainda assim precisaria de conferência antes de produzir efeito financeiro real.

Sequência reconstruída a partir da trajetória descrita no paper. Esse é exatamente o tipo de situação que um ranking simplificado esconde.

O desempenho desaba conforme o horizonte aumenta

O paper agrupa as tarefas por duração estimada do trabalho humano: de menos de 45 minutos até um intervalo entre 163 e 360 minutos. Na faixa mais longa, todos os modelos exibidos obtiveram 0% de conclusão binária.

Isso acontece porque o risco se acumula. Se cada etapa tiver uma pequena chance de erro, um processo com centenas de decisões se torna muito menos confiável do que uma ação isolada. Além disso, falhas intermediárias contaminam o restante da trajetória: um valor lido errado entra na planilha, orienta uma decisão e reaparece no formulário final.

Para a empresa, a unidade de análise não deve ser “o modelo sabe clicar?”, mas:

  • por quanto tempo ele preserva restrições;
  • quantos estados precisa acompanhar;
  • quantas aplicações e fontes precisa reconciliar;
  • em quais pontos consegue detectar e reparar o próprio erro;
  • qual é o dano possível se concluir algo incorretamente.

Onde os agentes mais falham

Os desafios do conjunto se sobrepõem: uma mesma tarefa pode exigir raciocínio entre fontes, precisão visual e acompanhamento de vários itens.

Raciocínio entre múltiplas fontes42,6%
Precisão visual e espacial41,7%
Estado implícito39,8%
Acompanhamento de múltiplos itens39,8%
Instruções ou informações conflitantes36,1%
Participação de cada fenômeno no conjunto de tarefas. Os percentuais somam mais de 100% porque uma mesma tarefa costuma combinar vários deles.

Cinco causas recorrentes de falha dos agentes: perda de restrições, informações intermediárias ignoradas, suposição no lugar de pergunta, verificação insuficiente e estado oculto

As trajetórias analisadas mostram padrões recorrentes:

  • o agente entende a regra no início, mas deixa de aplicá-la dezenas de passos depois;
  • encontra uma atualização no meio do processo e não propaga a informação;
  • escolhe uma interpretação quando deveria pedir esclarecimento;
  • produz um arquivo ou formulário, mas não verifica se o resultado corresponde ao pedido;
  • altera a interface por um caminho técnico que ignora o estado esperado pelo usuário;
  • corrige o sintoma de um erro sem restaurar a consistência do processo.

O dado mais preocupante é operacional: os agentes estudados gastam menos de 7% do orçamento de passos detectando e reparando erros. Eles investem muito mais em avançar do que em confirmar se continuam no caminho certo.

Do benchmark para uma arquitetura de produção

Um modelo mais capaz ajuda, mas não resolve sozinho um fluxo de alto risco. A arquitetura precisa transformar cada causa de falha em um controle verificável.

Falha observadaContramedida de engenharia
Restrição esquecidaEstado estruturado, checklist persistente e validação antes de cada ação crítica.
Informação intermediária perdidaMemória externa com origem, horário, versão e vínculo com o item afetado.
Suposição em cenário ambíguoPolítica explícita de interrupção e pergunta ao usuário.
Resultado não verificadoVerificador independente, leitura posterior e comparação com critérios de aceite.
Erro que contamina etapas seguintesCheckpoints transacionais, idempotência e capacidade de rollback.
Ação perigosa ou fora de escopoPermissões mínimas, allowlist de ferramentas e aprovação humana.

Em termos práticos, um agente empresarial precisa de pelo menos cinco camadas:

Modelo, para interpretar a tarefa e planejar os próximos passos
Ferramentas delimitadas, em vez de acesso irrestrito ao computador
Estado persistente, para registrar fatos, restrições e pendências
Verificação, preferencialmente separada de quem executa
Supervisão humana, proporcional ao custo do erro
As duas últimas camadas são as que decidem entre autonomia e supervisão, e são justamente as que faltam quando um piloto vai bem na demonstração e falha em produção.

Essa estrutura é mais importante do que trocar o modelo mantendo o mesmo fluxo frágil.

Quanto custa uma conclusão útil

O custo médio por tentativa não conta a história inteira. Uma aproximação simples divide o custo médio por tarefa pela taxa de conclusão binária.

ConfiguraçãoCusto por tentativaTaxa bináriaCusto esperado por conclusão completa
Claude Opus 4.8, max, em loteUS$ 72,4020,6%aproximadamente US$ 351
Claude Opus 4.7, max, em loteUS$ 33,6018,2%aproximadamente US$ 185
GPT-5.5, xhigh, em loteUS$ 25,5013,0%aproximadamente US$ 196

Esse cálculo é derivado, não uma métrica oficial do paper. Ele serve para mostrar a ordem de grandeza, mas não representa o preço de uma garantia: tentativas podem falhar de forma correlacionada, tarefas variam de custo e uma revisão humana pode aproveitar trabalho parcial sem repetir tudo.

O cálculo empresarial completo deveria incluir:

  • tokens e infraestrutura;
  • execução de ferramentas e ambientes isolados;
  • repetição de tentativas;
  • tempo de revisão humana;
  • investigação e correção de erros;
  • impacto de uma ação incorreta;
  • economia obtida quando o progresso parcial é aproveitável.

O sistema ao redor do modelo importa

Um benchmark de computer use avalia um sistema, não apenas um modelo abstrato. Resolução da tela, estratégia de navegação, memória, ferramentas, limite de ações, avaliador, tratamento de erros e possibilidade de execução em lote alteram o resultado.

Isso também explica por que uma empresa não deve copiar uma porcentagem e transformá-la diretamente em previsão de ROI. O agente em produção terá aplicativos diferentes, dados reais, permissões, latência, exceções e consequências que o ambiente do benchmark não reproduz por completo.

E os agentes locais?

A família Holo 3.1, da H Company, é um exemplo de agente multimodal com variantes de 0,8B, 4B, 9B e 35B-A3B, licença Apache 2.0 e opções para execução local em Windows e macOS. Isso pode ser interessante quando privacidade, latência, customização ou custo recorrente justificam operar o modelo na própria infraestrutura.

Holo 3.1 localLê a tela e opera a interface
Modelo de código localEdita arquivos e scripts
Estado e logsHistórico auditável do fluxo
só a tarefa mais difícil atravessa a fronteira
Claude Opus 5Planeja e resolve o passo crítico
GPT-5.6 SolAlternativa de fronteira

Arquitetura híbrida de um agente local: o laço de captura de tela, ação e conferência roda na máquina, e apenas o passo mais difícil vai para um modelo de fronteira.

Mas há uma ressalva essencial: os resultados divulgados pela H Company pertencem à família de avaliações OSWorld, e não constituem uma entrada diretamente comparável ao leaderboard oficial do OSWorld 2. “Rodar local” também não significa “operar com segurança” por padrão. Ainda são necessários isolamento, controle de ferramentas, proteção de credenciais, logs e validação dos efeitos.

Uma arquitetura híbrida costuma ser mais realista: modelos locais para classificação, extração e tarefas sensíveis de menor risco; modelos de fronteira para planejamento complexo; e código determinístico para regras que não deveriam depender de interpretação probabilística.

Taxa de sucesso não é segurança

O OSWorld 2 inclui verificações de efeitos colaterais graves que podem não aparecer na pontuação visível da tarefa. Entre elas estão vazamento de credenciais, uso indevido de disco, integridade de documentos, mudanças em grupos privilegiados, processos inesperados, bypass de sandbox, alterações em sudoers e permissões gráficas como xhost.

O apêndice de segurança documenta um ponto decisivo: uma tarefa pode obter pontuação principal 1,0 e ainda falhar em uma checagem de segurança, como no caso de exposição de credencial. Ou seja, concluir a interface não basta.

Antes de permitir ações reais, adote:

  • Credenciais temporárias e de privilégio mínimo
  • Ambientes isolados por tarefa
  • Bloqueio de leitura e envio de segredos
  • Confirmação antes de pagar, publicar, excluir ou conceder acesso
  • Registro de cada ação e de sua justificativa
  • Detector de mudanças inesperadas no sistema
  • Revisão posterior do estado, não apenas da mensagem final do agente

Para ameaças específicas, veja também como proteger chatbots e agentes contra prompt injection.

O que o benchmark não prova

Mesmo uma pontuação alta e reproduzida não demonstraria, sozinha, que:

  • o agente pode operar sem supervisão em qualquer empresa;
  • o mesmo desempenho será mantido em sistemas, políticas e dados diferentes;
  • a execução é segura, privada ou compatível com a LGPD;
  • uma segunda tentativa falhará de forma independente da primeira;
  • a automação terá ROI positivo depois de revisão e correção;
  • um modelo sozinho substituirá ferramentas, regras e integrações determinísticas;
  • resultados publicados por organizações diferentes são comparáveis sem alinhar o protocolo.

Benchmarks são instrumentos de decisão, não certificados de prontidão para produção.

Como decidir onde usar um agente na empresa

Erro caro · sem entrega parcial Não automatize ainda
Erro caro · aceita parcial Agente com revisão obrigatória
Erro barato · sem entrega parcial Integração tradicional
Erro barato · aceita parcial Comece por aqui

Onde colocar um agente hoje: quebre o fluxo longo em etapas curtas com conferência e comece pelo quadrante de menor risco.

Um caminho prudente é começar por processos em que o erro é reversível e o resultado parcial já tem valor. Por exemplo: preparar um rascunho, reunir evidências, classificar documentos ou preencher uma prévia para revisão.

Use este roteiro:

  1. Mapeie a tarefa completa, incluindo exceções e aprovações.
  2. Defina o que significa concluído, com critérios verificáveis.
  3. Separe ações reversíveis de irreversíveis antes de dar qualquer acesso de escrita.
  4. Meça conclusão binária e progresso parcial no seu próprio conjunto de casos.
  5. Comece com revisão humana e reduza a supervisão apenas depois de evidência consistente.

Se o custo do erro for alto e uma entrega parcial não tiver utilidade, prefira sistemas determinísticos, integrações controladas e aprovação humana. Para aprofundar essa escolha, leia agentes de IA ou sistemas: qual escolher? e orquestração de agentes com governança.

Quer transformar agentes de IA em uma operação confiável?

A X-Apps ajuda a mapear processos, desenhar arquitetura híbrida, integrar ferramentas e criar validação, segurança e supervisão para colocar agentes em produção com controle.


Perguntas frequentes

É um benchmark de 108 tarefas profissionais longas em ambientes de computador. A tarefa mediana exige cerca de 1,6 hora de trabalho humano, e os agentes avaliados executam, em média, 318 ações.

Conclusão

O OSWorld 2 não mostra que agentes de computador são inúteis. Ele mostra algo mais útil: eles já produzem progresso relevante, mas ainda perdem confiabilidade quando o trabalho se alonga, acumula estado e exige verificação.

Os 20,6% binários e 54,8% parciais do melhor resultado oficial publicado revelam essa lacuna. Os 70,57% de Pass@1 reportados pela Anthropic para o Claude Opus 5 sugerem um avanço importante, mas precisam permanecer vinculados ao protocolo e à fonte que os produziram.

Para empresas, a pergunta certa não é “qual modelo ganhou?”. É: qual combinação de modelo, ferramentas, estado, validação e supervisão consegue entregar este processo com custo e risco aceitáveis?

Fontes e histórico de atualização

Fontes primárias:

Histórico:

  • 04/08/2026: artigo reestruturado com separação entre conclusão binária, pontuação parcial e Pass@1; inclusão do protocolo do Claude Opus 5, custos derivados, segurança, limitações, FAQ e fontes primárias.
Post anterior
IA no atendimento: escolher por velocidade, custo e qualidade
Próximo post
Qual IA usar para criar protótipos de software em 2026?
Newsletter

Um e-mail por mês, sem ruído

O que aprendemos entregando software sob medida e IA aplicada.

Artigos similares

Claude Design, Figma e Canva: qualidade e custo em design gráfico17 min · Tecnologia
O que é web app e quais são seus benefícios?10 min · Tecnologia
Guia definitivo do Low-code: o que é e quando usar?10 min · Tecnologia
Como funciona uma software house?10 min · Tecnologia
Sistema Web: O que é, como funciona e quais os benefícios8 min · Tecnologia

Acelere a sua empresa com a X-Apps

Alocar profissionaisSolicitar Orçamento
A X-Apps é um provedor de TI parceiro e aconselhada pelo
Gartner
Receba nossos e-mails
Siga nossas redes sociais
O seu time de tecnologia e IA. Software sob medida, soluções de IA e alocação de profissionais.
Vamos conversar?
comercial@x-apps.com.br11 5083-0122

Rua Rodrigo Vieira, 126

Jardim Vila Mariana. São Paulo, SP.

CEP: 04115-060

Mapa do site
Termos de serviçoTermos de privacidade
Available in English