
Claude dirige 26 % de la R&D d’Anthropic. Qui vérifie ?
Anthropic dit que Claude dirige un quart de sa recherche en IA sous supervision humaine. Je regarde ce que ce chiffre mesure et qui vérifie les résultats.
Tous les articles portant l’étiquette model-evaluation, du plus récent au plus ancien.

Anthropic dit que Claude dirige un quart de sa recherche en IA sous supervision humaine. Je regarde ce que ce chiffre mesure et qui vérifie les résultats.

DeepSWE place Luna Max à 2,2 points de Sol High pour près d’un sixième du coût. J’explique pourquoi leur façon de travailler reste très différente.