
Claude lidera 26% da I&D da Anthropic. Quem verifica?
A Anthropic diz que Claude lidera um quarto da investigação em IA sob supervisão humana. Analiso o que o valor mede e quem continua a verificar os resultados.
Todos os artigos com a tag model-evaluation, do mais recente para o mais antigo.

A Anthropic diz que Claude lidera um quarto da investigação em IA sob supervisão humana. Analiso o que o valor mede e quem continua a verificar os resultados.

O DeepSWE põe Luna Max 2,2 pontos atrás de Sol High por cerca de um sexto do custo. Explico porque podem funcionar de forma tão diferente num repositório.