
Claude leitet 26 % von Anthropics KI-Forschung. Wer prüft?
Laut Anthropic leitet Claude ein Viertel seiner KI-Forschung unter menschlicher Aufsicht. Ich prüfe, was die Zahl misst und wer die Ergebnisse kontrolliert.
Alle Beiträge mit dem Tag model-evaluation, neueste zuerst.

Laut Anthropic leitet Claude ein Viertel seiner KI-Forschung unter menschlicher Aufsicht. Ich prüfe, was die Zahl misst und wer die Ergebnisse kontrolliert.

Bei DeepSWE liegt Luna Max 2,2 Punkte hinter Sol High, doch Luna braucht fast dreimal so viele Schritte. Ich zeige, warum das in Repositorys zählt.