Claude leitet 26 % von Anthropics KI-Forschung. Wer prüft?

Laut Anthropic leitet Claude ein Viertel seiner KI-Forschung unter menschlicher Aufsicht. Ich prüfe, was die Zahl misst und wer die Ergebnisse kontrolliert.

Releases
Auf dieser Seite
  1. Was bedeutet es, wenn Claude 26 % der Forschung leitet?
  2. Wie wurde die Prozentzahl gemessen?
  3. Verbessert KI sich damit bereits autonom selbst?
  4. Was würde ich an einem Programmierablauf ändern?

Laut Anthropic leitete Claude in einer Momentaufnahme vom August 2026 rund 26 % der internen KI-Forschung und -Entwicklung, unter menschlicher Aufsicht. Der Bericht vom 17. September stuft keine der gemessenen Arbeiten als vollständig autonom ein. Für mich folgt daraus: Die Leitung einer Untersuchung und die Prüfung ihrer Ergebnisse müssen getrennt gemessen werden. [1]

Was bedeutet es, wenn Claude 26 % der Forschung leitet?

Nach Anthropics Einteilung übernimmt Claude die Führung bei einer Aufgabe, während ein Mensch die Aufsicht behält. Das unterscheidet sich von Forschung ohne menschliche Beteiligung. Ein System kann selbst entscheiden, wie es eine Aufgabe ausführt, und trotzdem jemanden brauchen, der den Nutzen des Ergebnisses beurteilt. [1]

Die Diskussion vom 17. September in r/singularity griff die 26 % auf. Für mich ist das ein guter Anlass, den zugrunde liegenden Bericht zu lesen, gerade weil „leiten“ mehr nahelegt, als die Messung voraussetzt. Ein Entwickler könnte sich darunter eine KI vorstellen, die ein Forschungsprogramm auswählt, Experimente durchführt und über die Veröffentlichung entscheidet. Das sind unterschiedliche Verantwortlichkeiten. [2]

So würde ich sie bei der Bewertung eines Agenten in meiner eigenen Arbeit trennen. Das ist mein Prüfschema, nicht Anthropics offizielle Bewertungstabelle.

Verantwortung Meine Frage Gewünschter Nachweis
Aufgabe auswählen Wer entscheidet, was sich lohnt? Ein Ziel mit Abnahmekriterien
Arbeit ausführen Wer wählt die Schritte und führt sie aus? Eine Aufzeichnung der Aktionen und Zwischenergebnisse
Ergebnis abnehmen Wer prüft, ob die Schlussfolgerung trägt? Eine Prüfung anhand unabhängiger Belege

Wer die mittlere Zeile delegiert, hat die anderen beiden noch nicht geklärt. Diese Unterscheidung steckt auch hinter meinem Beitrag über die Programmier- und Aufsichtsprobleme von Opus 5: Ein umfangreiches Ergebnis zu liefern und es leicht überprüfbar zu machen sind unterschiedliche Fähigkeiten.

Wie wurde die Prozentzahl gemessen?

Anthropic beschreibt eine interne Schätzung aus Arbeitsaufzeichnungen und modellgestützter Einordnung. Für die Gewichtung dient die Arbeitszeit als Näherung; das Wochengewicht einer Person wird auf ihre Aufgaben verteilt. Damit lässt sich verfolgen, wie sich die Arbeitsweise verändert. Eingesparte Stunden werden so nicht direkt gemessen. [1]

Dieser Nenner verändert meine Lesart der Schlagzeile. Aus „Die KI leitet einen Teil der Arbeit“ wird nicht automatisch „Wir brauchen entsprechend weniger Menschen“. Für die zweite Aussage müsste ich wissen, was die Menschen nach der Delegation tun, wie viel Zeit sie mit Prüfungen verbringen und ob sich Qualität oder Menge der akzeptierten Ergebnisse verändert haben.

Nehmen wir einen hypothetischen Entwickler, der ein Experiment delegiert und anschließend den Nachmittag damit verbringt, dessen Versuchsaufbau zu prüfen. Der Agent kann die Ausführung geleitet haben, obwohl der Entwickler weiterhin viel Zeit in das Projekt steckt. Vielleicht kann derselbe Entwickler aber auch mehrere brauchbare Experimente in der Zeit prüfen, die früher für eines nötig war. Eine bloße Aufgabeneinteilung unterscheidet diese Fälle nicht.

Ich würde den Bericht nutzen, um Fragen für eine genauere Bewertung zu entwickeln. So nutze ich auch Vergleiche von KI-Benchmarks, um zu entscheiden, was einen Test verdient. Der nächste sinnvolle Schritt ist, Delegation mit akzeptierten Ergebnissen und Prüfaufwand zu verbinden. Sonst misst ein Team mehr KI-Aktivität, ohne zu erfahren, ob seine Arbeit besser geworden ist.

Verbessert KI sich damit bereits autonom selbst?

Anthropics separater Essay When AI builds itself sagt, dass rekursive Selbstverbesserung noch nicht erreicht und auch nicht unvermeidlich ist. Die Auswahl von Forschungszielen und die Bewertung von Ergebnissen nennt er als Bereiche, in denen menschliche Erfahrung weiterhin zählt. Der Bericht beschreibt damit die Organisation von Forschung, nicht einen vollständig selbstlaufenden Entwicklungsprozess. [3]

Für rekursive Selbstverbesserung reicht es nicht, dass eine KI Code zum nächsten Modell beiträgt. Interessant wäre der Nachweis, dass Verbesserungen das System zu weiteren Verbesserungen befähigen und es dabei weniger von Menschen abhängt. Ein nützlicher Beitrag allein belegt diesen fortlaufenden Prozess noch nicht. Dieselbe Unterscheidung untersuche ich anhand von Z.ais Bericht über die Optimierung von Inferenzsoftware mit GLM.

Meiner Einschätzung nach steigt zunächst der Druck auf die Prüfung. Wenn sich ein Experiment leichter vorschlagen lässt, muss weiterhin jemand beurteilen, ob es die gestellte Frage beantwortet. Eine überzeugend formulierte Erklärung für einen schlechten Test kann die Prüfung sogar erschweren, weil mehr plausibles Material kontrolliert werden muss.

Deshalb würde ich die Erzeugung einer Antwort von den Belegen trennen, anhand derer ich sie akzeptiere. Bei Software könnte das heißen, das Verhalten gegen Anforderungen und Tests zu prüfen, die nicht passend zum Patch umgeschrieben wurden. In der Forschung wäre die Frage, welches Ergebnis die vorgeschlagene Erklärung infrage stellen würde. Das sind Vorschläge zur Bewertung, keine zusätzlichen Ergebnisse aus Anthropics Bericht.

Was würde ich an einem Programmierablauf ändern?

Ich würde vor der Delegation einer größeren Aufgabe festlegen, welche Prüfung nötig ist. Der Agent braucht ein klares erwartetes Ergebnis. Wer es abnimmt, braucht zugleich eine Möglichkeit, seine Richtigkeit festzustellen. Das erscheint mir als sinnvollere Reaktion auf den Bericht, als einfach mehr Agenten einzusetzen.

Bei einer Untersuchung würde ich die Belege für die Schlussfolgerung und offene Widersprüche anfordern. Bei einer Codeänderung würde ich fragen, welches Verhalten sich geändert hat und wie es überprüft wurde. Anschließend würde ich beurteilen, ob die Prüfung weniger Aufwand macht, als die Arbeit direkt zu erledigen. Dazu gehört auch die Korrektur eines zunächst überzeugenden Fehlers.

Dieselbe Frage gehört zum Entwurf von Anwendungen auf Basis der OpenAI Agents API. Eine Anwendung kann die Ausführung delegieren und die Abnahme bei der Person lassen, die das Ergebnis verantwortet. Wo diese Abnahme stattfindet, ist eine Produktentscheidung.

Beim nächsten Modellstart würde ich darauf achten, was sich nach einem langen Lauf tatsächlich prüfen lässt. Ein Modell, das mehr Arbeit erledigt, ist nützlich. Wie viel davon ich akzeptieren kann, hängt davon ab, welche Teile ich verlässlich beurteilen kann.

Quellen

  1. Measurements for understanding the pace of AI development inside frontier labsAnthropic Institute · 2026-09-17
  2. Anthropic reveals Claude is now leading 26% of its own R&D work, up from nearly zero 6 months agoReddit, r/singularity · 2026-09-17
  3. When AI builds itselfAnthropic Institute