Claude lidera 26% da I&D da Anthropic. Quem verifica?
A Anthropic diz que Claude lidera um quarto da investigação em IA sob supervisão humana. Analiso o que o valor mede e quem continua a verificar os resultados.

A Anthropic afirma que Claude liderava 26% do seu trabalho interno de investigação e desenvolvimento em IA numa medição de agosto de 2026, sob supervisão humana. O relatório de 17 de setembro não identifica trabalho totalmente autónomo entre as atividades medidas. A minha conclusão é que dirigir a investigação e verificar os resultados devem ser medidos separadamente. [1]
O que significa Claude liderar 26% da investigação?
Segundo a classificação da Anthropic, Claude assume a direção do trabalho enquanto uma pessoa o supervisiona. É diferente de investigar sem intervenção humana. Um sistema pode decidir como executar uma tarefa e continuar a depender de outra pessoa para avaliar se o resultado é útil. [1]
A discussão de 17 de setembro no r/singularity retomou o valor de 26%. Parece-me um bom motivo para ler o relatório original, sobretudo porque «liderar» sugere uma interpretação mais ampla do que aquela que a medição exige. Um programador pode imaginar uma IA que escolhe um programa de investigação, executa as experiências e decide o que publicar. São responsabilidades distintas. [2]
É assim que as separaria ao avaliar um agente no meu trabalho. Trata-se de uma proposta minha para a revisão, não da tabela oficial de classificação da Anthropic.
| Responsabilidade | Pergunta a fazer | Elementos que pediria |
|---|---|---|
| Escolher a tarefa | Quem decide o que vale a pena fazer? | Um objetivo e os critérios de aceitação |
| Executar o trabalho | Quem escolhe e executa os passos? | Um registo das ações e dos resultados intermédios |
| Aceitar o resultado | Quem verifica se a conclusão se sustenta? | Uma revisão com base em provas independentes |
Delegar a linha do meio não resolve as outras duas. A distinção também está presente na minha análise dos problemas de programação e supervisão do Opus 5: produzir um resultado significativo e facilitar a confiança nesse resultado são capacidades diferentes.
Como foi medida a percentagem?
A Anthropic descreve uma estimativa interna baseada em registos de trabalho e numa classificação assistida por modelos. A ponderação usa o tempo das pessoas como aproximação, repartindo o peso semanal de cada pessoa pelas suas tarefas. Permite acompanhar mudanças na forma de trabalhar, em vez de medir diretamente as horas poupadas. [1]
Esse denominador muda a minha leitura do título. «A IA lidera uma parte do trabalho» não pode passar automaticamente a «precisamos de uma proporção equivalente de pessoas a menos». Para sustentar a segunda afirmação, gostaria de saber o que as pessoas fazem depois de delegar, quanto tempo dedicam à revisão e se a qualidade ou o volume dos resultados aceites mudou.
Imagine um engenheiro que delega uma experiência e passa a tarde a verificar se as condições do teste eram válidas. O agente pode ter liderado a execução enquanto o engenheiro continua a dedicar bastante tempo ao projeto. Em alternativa, o mesmo engenheiro poderia rever várias experiências úteis no tempo anteriormente necessário para uma. Uma classificação de tarefas, por si só, não distingue estas situações.
Usaria o relatório para definir as perguntas de uma avaliação mais detalhada, tal como uso as comparações de benchmarks de IA para decidir o que merece ser testado. O passo seguinte útil é relacionar a delegação com os resultados aceites e o esforço de revisão. Caso contrário, uma equipa pode medir mais atividade da IA sem saber se o seu trabalho melhorou.
Isto significa que a IA se melhora de forma autónoma?
Noutro ensaio, When AI builds itself, a Anthropic afirma que o melhoramento recursivo ainda não foi alcançado e não é inevitável. Aponta também a escolha de objetivos de investigação e a avaliação dos resultados como áreas onde a experiência humana continua a ser importante. O relatório descreve a organização da investigação, não um ciclo de desenvolvimento inteiramente autónomo. [3]
O melhoramento recursivo exigiria mais do que uma IA a contribuir com código para o modelo seguinte. O que interessa demonstrar é que as melhorias permitem ao sistema produzir outras melhorias com menor dependência das pessoas. Uma contribuição útil não demonstra, por si só, a existência desse processo contínuo. Analiso a mesma distinção no relato da Z.ai sobre o uso de GLM para otimizar software de inferência.
Na minha leitura, a pressão imediata recai sobre a verificação. Se propor uma experiência se torna mais fácil, alguém continua a ter de decidir se ela responde à pergunta. Uma explicação bem escrita de um teste mal concebido pode dificultar essa tarefa ao dar ao revisor mais material plausível para verificar.
Por isso, separaria o mecanismo que produz uma resposta das provas usadas para a aceitar. Em desenvolvimento de software, isso pode significar verificar o comportamento face a requisitos e testes que não tenham sido reescritos para acomodar a alteração. Na investigação, significa perguntar que resultado poria em causa a explicação proposta. São escolhas de avaliação, não conclusões adicionais do relatório da Anthropic.
O que mudaria num fluxo de trabalho de programação?
Definiria a revisão necessária antes de delegar uma tarefa maior. O agente precisa de um resultado esperado claro, mas quem o revê também precisa de uma forma de estabelecer que está correto. Parece-me uma resposta mais útil ao relatório do que simplesmente aumentar o número de agentes.
Numa investigação, pediria as provas que sustentam a conclusão e as contradições ainda por resolver. Numa alteração de código, perguntaria que comportamento mudou e como foi verificado. Depois avaliaria se rever exige menos esforço do que fazer o trabalho diretamente, incluindo o tempo gasto a corrigir um erro inicialmente convincente.
A mesma pergunta deve fazer parte da conceção de aplicações baseadas na OpenAI Agents API. Uma aplicação pode delegar a execução e manter a aceitação com a pessoa responsável pelo resultado. Decidir onde ocorre essa aceitação faz parte da conceção do produto.
No próximo lançamento de um modelo, prestaria atenção ao que um revisor consegue verificar após uma execução longa. Um modelo que faz mais trabalho é útil; saber em que partes se pode confiar determina quanto desse trabalho posso realmente aceitar.





