Wie Google-Forscher verhindern wollen, dass sich selbst verbessernde KI-Agenten nur auswendig lernen
Sonntag 14:26 · 04.10. · The Decoder

Plus Forschung URL in die Zwischenablage kopieren Artikel teilen Zum Kommentarbereich Wie Google-Forscher verhindern wollen, dass sich selbst verbessernde KI-Agenten nur auswendig lernen Jonathan Kemper View the LinkedIn Profile of Jonathan Kemper 4. Oktober 2026 Nano Banana Pro prompted by THE DECODER KI-Agenten, die ihre eigene Arbeitsumgebung immer weiter optimieren, neigen schnell dazu, sich zu stark auf ihre Testaufgaben zu spezialisieren. Eine neue Methode von Google Cloud AI Research und mehreren Universitäten soll das verhindern und dabei Rechenkosten sparen.
Um ein festes Sprachmodell herum liegt bei modernen KI-Agenten ein sogenanntes Harness , ein Gerüst aus Prompts, Ablaufplänen, Werkzeugen, Speicher und der Steuerung dessen, was das Modell in jedem Schritt sieht.
Dieses Gerüst entscheidet darüber, ob ein Agent die richtige Datei liest, bevor er sie ändert, ob er sich von einem Fehler erholt und ob er seine Ergebnisse sauber abliefert. Ein Großteil des jüngsten Fortschritts bei Agenten stammt laut einem neuen Forschungspapier aus der Arbeit an diesem Gerüst, nicht aus neuen Modellen.
Bisher war das Handarbeit. Menschen sehen sich fehlgeschlagene Durchläufe an und bessern das Gerüst manuell nach. Neuere Methoden automatisieren diese Schleife, indem ein Sprachmodell das Gerüst selbst verändert, immer wieder, auf Basis von Feedback aus den Testaufgaben.
Die Forscher beschreiben das als praktische Form der rekursiven Selbstverbesserung: Das System liefert Rückmeldung, mit der es das Gerüst optimiert, das anschließend sein eigenes Verhalten steuert.
Das Paper zeigt, dass diese Selbstoptimierung eine Kehrseite hat. Weil immer dasselbe begrenzte Set an Testaufgaben genutzt wird, lernt der Agent diese Aufgaben faktisch auswendig. Auf den Trainingsaufgaben steigt seine Leistung, auf neuen, ungesehenen Aufgaben aber schrumpfen die Gewinne oder verschwinden ganz.
Nach Angaben der Forscher geschieht das auf mehreren Wegen: Die Suche merke sich Muster, die nur zu diesem einen Benchmark passen; sie bevorzuge Kandidaten, die nur durch Zufall gut abschneiden; und sie häufe unnötige Komplexität an, die den Testwert hebt, ohne den Agenten wirklich besser zu machen.
RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) setzt an beiden Enden der Optimierungsschleife an, lässt das Gerüst aber weiterhin komplett veränderbar. Beim Vorschlagen neuer Änderungen begrenzt ein Budget, wie viele unabhängige Anpassungen ein Kandidat auf einmal bündeln darf.
Dieses Budget sinkt über die Zeit. Anfangs sind größere Umbauten erlaubt, später nur noch kleine, klar zuordbare Änderungen. Zusätzlich merkt sich das System frühere Versuche, damit es nicht ständig dieselben erfolglosen Ideen erneut verfolgt. Stockt der Fortschritt, wird gezielt an bislang unangetasteten Teilen des Gerüsts experimentiert.
Bei der Auswahl der Änderungen prüft ein Kritiker jeden Vorschlag und verwirft solche, die Aufgabennamen, Lösungen oder andere benchmark-spezifische Tricks fest einbauen. Eine weitere Regel akzeptiert höhere Rechenkosten nur dann, wenn ihnen ein messbarer Leistungsgewinn gegenübersteht. Komponenten, die keinen Nutzen mehr bringen, werden wieder entfernt.
Getestet wurde RRSI auf acht Benchmarks in drei Bereichen, nämlich Programmierung, agentische Büroarbeit und Ingenieursdesign. Das zugrunde liegende Modell war durchgehend eingefroren, verwendet wurde Claude Opus 4.8 . Als Vergleich dienten das unveränderte Ausgangsgerüst sowie vier aktuelle Optimierungsmethoden.
Laut dem Papier gewinnt RRSI bis zu 14,1 Punkte auf den Aufgaben, mit denen es trainiert wurde, und bis zu 4,7 Punkte auf fünf Benchmarks, die es nie gesehen hat, bei rund 30 Prozent weniger Token-Verbrauch im Betrieb als die unregulierte Variante. Auf keinem der ungesehenen Benchmarks fiel die Gesamtleistung unter den Ausgangswert, was bei einem auswendig lernenden Gerüst typischerweise passiert.
Alle Methoden schnitten auf den Trainingsaufgaben gut ab, doch auf neuen Aufgaben kehrte sich das Bild um. Zwei Methoden landeten sogar unter dem Ausgangsgerüst. RRSI erzielte den kleinsten Trainingsgewinn aller Varianten und war zugleich die einzige Methode, die auf den ungesehenen Aufgaben deutlich über dem Ausgangswert lag. Diesen Kompromiss sollen die Bremsmechanismen erzeugen.
Ein mit Gemini 3.5 Flash optimiertes Coding-Gerüst hob die Genauigkeit des deutlich schwächeren Gemini 3.1 Flash Lite unverändert von 11,2 auf 14,6 Punkte. Die gefundenen Mechanismen hängen also nicht von der Leistungsstufe des Modells ab, mit dem sie erarbeitet wurden.
Die Autoren räumen ein, dass ihre Untersuchung auf das Gerüst mit festen Modellen beschränkt bleibt und Fälle mit veränderten Modellgewichten nicht abdeckt.
Das Fazit: KI-Agenten macht Selbstverbesserung nur dann zuverlässig leistungsfähiger, wenn wiederholtes Feedback in dauerhafte Änderungen überführt wird. Der Code ist auf GitHub verfügbar.
Handgebaute Gerüste übertragen sich oft schlecht auf neue Aufgaben, wie Tests zu ARC-AGI-3 gezeigt haben. Opus 4.6 erreichte dort mit einem eigens gebauten Harness 97,1 Prozent in einer bekannten Umgebung und 0 Prozent in einer unbekannten. Nvidia hatte daher gerade mit SoL-Pi ein verwandtes Verfahren vorgestellt, bei dem ein Research-Agent den Harness von Coding-Agenten automatisch umbaut und bis zu 49 Prozent der Token einspart, ohne dass die Leistung spürbar sinkt.
Kurz zuvor hatte Google Agenten aus früheren Suchverläufen "träumen" lassen , damit sie ihre Suchstrategie verbessern. Auch dort bleibt das Modell selbst unverändert.
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.