Manuell
Der Großteil der SoftwaregeschichteMenschen schreiben jede Zeile. Werkzeuge kompilieren, linten und meckern. Die Tastatur ist die Fabrik.
- Keine. Das ist der Boden.
Sechs Stufen der Fabrikautonomie, die Schwellen dazwischen und unsere Prognose, wie weit uns 2026 bringt. Jetzt aufgeschrieben, damit du uns später benoten kannst.
Vorhersagen über KI sind billig, weil sie niemand nachprüft. Diese Seite ist ein Bewertungsraster, kein Bauchgefühl: Jede Schwelle unten ist für ein echtes Team, das echte Software ausliefert, entweder wahr oder falsch. Wir aktualisieren sie, wenn Schwellen fallen, und wir verschieben die Latte nicht.
F3 · Delegiert
2.5/3 F3 · 1/5 F4
2027 · Prognose
Übernommen davon, wie selbstfahrende Autos bewertet werden, angewandt darauf, wie Software entsteht. Der spannende Sprung ist F3 zu F4: von Agenten, an die du delegierst, zu einer Fabrik, die du dirigierst.
F3 · you are here
Menschen schreiben jede Zeile. Werkzeuge kompilieren, linten und meckern. Die Tastatur ist die Fabrik.
Autovervollständigung wird gut. Ein Modell schlägt die nächsten Tokens vor, aber nichts geht raus, ohne dass ein Mensch das meiste davon tippt.
Ein Agent schreibt ganze Funktionen und Dateien, während ein Mensch jeden Schritt beobachtet und jeden Befehl freigibt. Ein Agent, ein Mensch. Schneller, aber weiterhin seriell.
Der Agent verantwortet eine Aufgabe vom Ticket bis zum Diff. Der Mensch reviewt das Ergebnis, nicht die Tastenanschläge. Die Aufmerksamkeit verlagert sich vom Schreiben von Code zum Spezifizieren und Beurteilen von Arbeit. Eine Ingenieurin betreibt mehrere Agenten gleichzeitig in isolierten Arbeitsbereichen.
Flotten von Agenten planen, implementieren, reviewen und testen die Arbeit der anderen. Menschen geben die Richtung vor, entscheiden Ausnahmen und verantworten den Geschmack. Die Einheit menschlicher Aufmerksamkeit ist nicht mehr der Pull Request. Sie ist die Entscheidung.
Ergebnis rein, Software raus. Menschen geben Absicht, Randbedingungen und Budget vor. Die Fabrik plant sich selbst, liefert kontinuierlich aus, überwacht, was sie ausgeliefert hat, und rollt sich selbst zurück. Die meisten Änderungen werden ohne Menschen im Ablauf gemergt, und die Störungsrate steigt nicht.
Teils Protokoll, teils Wette. Die ersten beiden Einträge passieren bereits. Der Rest ist konkret genug formuliert, um falsch sein zu können.
Code zu schreiben ist nicht mehr das, wofür Entwicklerstunden draufgehen. Ihn zu lesen schon. Teams, die 2025 auf parallele Agenten umgestiegen sind, laufen zuerst gegen die Wand: Zehn Agenten produzieren vor dem Mittagessen mehr Diffs, als ein Team bis Freitag ehrlich reviewen kann.
Die Antwort: Agenten reviewen Agenten, und Menschen prüfen Stichproben, statt alles zu lesen. Vertrauen entsteht statistisch, nicht pro Diff.
Agenten-Reviewer finden in Blindtests eingebaute Regressionen genauso zuverlässig wie durchschnittliche menschliche Reviewer.
Die Stellenbeschreibung verschiebt sich. Entwickler sind nicht länger Tipper mit Geschmack, sondern Disponenten mit Geschmack: Arbeit zerlegen, an Flotten verteilen, Konflikte zwischen Agenten schlichten, die beide dasselbe Modul angefasst haben.
Werkzeuge, die Agenten als Flotte behandeln und nicht als Chatfenster, werden zur Standardschnittstelle zur Codebasis.
Eine Ingenieurin hält 10 oder mehr parallele Arbeitsstränge am Laufen, und das Auflösen von Merge-Konflikten zwischen Agenten-Branches ist selbst weitgehend automatisiert.
Die Zuverlässigkeit über lange Zeiträume überschreitet eine Schwelle. Arbeit, die um 18 Uhr vergeben wird, ist um 9 Uhr so oft mergebar, dass es sich wie eine stillstehende Fabrik anfühlt, die Nachtschicht nicht einzuplanen.
Umgebungs-Setup, flaky Tests und Zugangsdaten-Verkabelung — die langweiligen Fehlerquellen, die 2025 unbeaufsichtigte Läufe zerlegt haben — werden größtenteils wegkonstruiert statt wegmodelliert.
Unbeaufsichtigte Läufe von 8 Stunden oder mehr gelingen bei der Mehrheit der Routine-Tickets, ohne dass ein Mensch sie entblockt.
Die ersten Teams, kleine, liefern mehrheitlich von Agenten geschriebenen Code aus, ohne jede Zeile zu lesen, und ihre Fehlerraten halten. Nichts Mystisches dahinter: Review-Schichten, Canaries, schnelles Rollback und die Gewohnheit, Spezifikationen statt Code zu schreiben.
Alle streiten darüber, ob sich das verallgemeinern lässt. Genau dieser Streit ist das Zeichen, dass die Stufe erreicht wurde.
Mindestens ein Team, das wir benennen können, unseres eingeschlossen, besteht ein ganzes Quartal lang jedes F4-Kriterium und veröffentlicht die Zahlen.
Wir prognostizieren für 2026 oder 2027 kein vollständig autonomes Fahren. Die ehrlichen Unbekannten: ob Agenten-Review gegen bösartige Komplexität standhält, ob Spezifikation das Lesen von Code als Vertrauensanker im großen Maßstab ersetzen kann und ob die Rechenökonomie die Nachtschicht billiger hält als die Menschen, die sie ergänzt. F5 ist ein Rubrikeintrag, damit wir es erkennen, wenn wir es sehen — kein Versprechen.
Unsere Einschätzung im August 2026, basierend auf unserem eigenen Team und den Teams, die wir genau beobachten. F3 ist größtenteils offen. F4 ist größtenteils geschlossen. Diese Lücke ist die Arbeit.
2 offen 3 teilweise 3 geschlossenvon 8 F3- und F4-Schwellen
Routine-Tickets ohne Eingriff mitten in der Aufgabe
Standard für gut abgegrenzte Arbeit in isolierten Arbeitsbereichen.
3+ parallele Arbeitsstränge pro Ingenieur
Tägliche Praxis bei unserem Team und unseren intensivsten Nutzern.
Mehrheit ohne Nachbearbeitung bei gemergten Agenten-PRs
Gilt für Routinearbeit, noch nicht für knifflige Refactorings.
Die Hälfte der gemergten Änderungen ist Agenten-Code ohne Nachbearbeitung
Menschen bearbeiten oder steuern die meisten gemergten Diffs weiterhin stark.
Agenten-Review auf Augenhöhe mit menschlichem Review
Agenten-Review findet echte Bugs, wird allein aber noch nicht vertraut.
10+ parallele Arbeitsstränge ohne Kontrollverlust
An guten Tagen möglich. Der Aufwand für Aufsicht wächst noch zu schnell.
Unbeaufsichtigte Läufe über Nacht, morgens mergebar
Funktioniert, wenn die Umgebungen sauber sind. Umgebungen sind selten sauber.
Ticket bis Produktion unter einem Tag, Median
Review- und CI-Warteschlangen fressen die Gewinne der Agenten auf.
Superset ist die Werkbank für den Übergang von F3 zu F4: parallele Agenten in isolierten Arbeitsbereichen, Flotten, die sich wirklich beaufsichtigen lassen, und eine Review-Oberfläche für Code, den du nicht selbst geschrieben hast.