Prognose · Veröffentlicht im August 2026

Die selbstfahrende Softwarefabrik

Sechs Stufen der Fabrikautonomie, die Schwellen dazwischen und unsere Prognose, wie weit uns 2026 bringt. Jetzt aufgeschrieben, damit du uns später benoten kannst.

Vorhersagen über KI sind billig, weil sie niemand nachprüft. Diese Seite ist ein Bewertungsraster, kein Bauchgefühl: Jede Schwelle unten ist für ein echtes Team, das echte Software ausliefert, entweder wahr oder falsch. Wir aktualisieren sie, wenn Schwellen fallen, und wir verschieben die Latte nicht.

Das Bewertungsraster

Sechs Stufen der Fabrikautonomie

Übernommen davon, wie selbstfahrende Autos bewertet werden, angewandt darauf, wie Software entsteht. Der spannende Sprung ist F3 zu F4: von Agenten, an die du delegierst, zu einer Fabrik, die du dirigierst.

Fig. 1 · Human share of the effort behind a merged changeSchematic, by autonomy level. Hover for values.
0%50%100%100%F0F1F235%F3F42%F5

F3 · you are here

F0

Manuell

Der Großteil der Softwaregeschichte

Menschen schreiben jede Zeile. Werkzeuge kompilieren, linten und meckern. Die Tastatur ist die Fabrik.

Schwellen
  • Keine. Das ist der Boden.
F1

Assistiert

2021 bis 2023

Autovervollständigung wird gut. Ein Modell schlägt die nächsten Tokens vor, aber nichts geht raus, ohne dass ein Mensch das meiste davon tippt.

Schwellen
  • Modellvorschläge tauchen in der Mehrheit neuer Dateien auf.
  • Niemand reviewt deswegen anders.
F2

Beaufsichtigt

2024

Ein Agent schreibt ganze Funktionen und Dateien, während ein Mensch jeden Schritt beobachtet und jeden Befehl freigibt. Ein Agent, ein Mensch. Schneller, aber weiterhin seriell.

Schwellen
  • Ein Agent führt Änderungen über mehrere Dateien vollständig durch.
  • Der Mensch liest jede Zeile, bevor sie gemergt wird.
  • Ein Mensch steuert höchstens einen Agenten gleichzeitig.
F3

Delegiert

2025 bis heuteWo ernsthafte Teams stehen

Der Agent verantwortet eine Aufgabe vom Ticket bis zum Diff. Der Mensch reviewt das Ergebnis, nicht die Tastenanschläge. Die Aufmerksamkeit verlagert sich vom Schreiben von Code zum Spezifizieren und Beurteilen von Arbeit. Eine Ingenieurin betreibt mehrere Agenten gleichzeitig in isolierten Arbeitsbereichen.

F4

Orchestriert

Die Wette für 2026Die Fabrik

Flotten von Agenten planen, implementieren, reviewen und testen die Arbeit der anderen. Menschen geben die Richtung vor, entscheiden Ausnahmen und verantworten den Geschmack. Die Einheit menschlicher Aufmerksamkeit ist nicht mehr der Pull Request. Sie ist die Entscheidung.

F5

Autonom

Keine Behauptung für 2026Vollständig autonom

Ergebnis rein, Software raus. Menschen geben Absicht, Randbedingungen und Budget vor. Die Fabrik plant sich selbst, liefert kontinuierlich aus, überwacht, was sie ausgeliefert hat, und rollt sich selbst zurück. Die meisten Änderungen werden ohne Menschen im Ablauf gemergt, und die Störungsrate steigt nicht.

Schwellen
  • Die Mehrheit der Produktionsänderungen wird gemergt, ohne dass ein Mensch den Diff liest.
  • Change-Failure-Rate auf oder unter dem Niveau der Menschen-Ära über zwei Quartale in Folge.
  • Die Fabrik nimmt eigene fehlerhafte Deployments schneller zurück als eine Person in Rufbereitschaft.
  • Menschen im Ablauf sind für Ermessensentscheidungen da, nicht für den Durchsatz.
Die Prognose

Wie 2026 verläuft

Teils Protokoll, teils Wette. Die ersten beiden Einträge passieren bereits. Der Rest ist konkret genug formuliert, um falsch sein zu können.

Fig. 2 · Merged changes written by agents, zero human editsIndustry median, our estimate. Dashed is forecast. The first F4 teams cross the gate earlier.
0%25%50%20242025202620272028F4 gate · 50%TODAY
Anfang 2026

Review wird zum Engpass

Eingetreten

Code zu schreiben ist nicht mehr das, wofür Entwicklerstunden draufgehen. Ihn zu lesen schon. Teams, die 2025 auf parallele Agenten umgestiegen sind, laufen zuerst gegen die Wand: Zehn Agenten produzieren vor dem Mittagessen mehr Diffs, als ein Team bis Freitag ehrlich reviewen kann.

Die Antwort: Agenten reviewen Agenten, und Menschen prüfen Stichproben, statt alles zu lesen. Vertrauen entsteht statistisch, nicht pro Diff.

Was wahr werden muss

Agenten-Reviewer finden in Blindtests eingebaute Regressionen genauso zuverlässig wie durchschnittliche menschliche Reviewer.

Mitte 2026

Der Disponent tritt auf

Läuft

Die Stellenbeschreibung verschiebt sich. Entwickler sind nicht länger Tipper mit Geschmack, sondern Disponenten mit Geschmack: Arbeit zerlegen, an Flotten verteilen, Konflikte zwischen Agenten schlichten, die beide dasselbe Modul angefasst haben.

Werkzeuge, die Agenten als Flotte behandeln und nicht als Chatfenster, werden zur Standardschnittstelle zur Codebasis.

Was wahr werden muss

Eine Ingenieurin hält 10 oder mehr parallele Arbeitsstränge am Laufen, und das Auflösen von Merge-Konflikten zwischen Agenten-Branches ist selbst weitgehend automatisiert.

Ende 2026

Die Nachtschicht

Prognose

Die Zuverlässigkeit über lange Zeiträume überschreitet eine Schwelle. Arbeit, die um 18 Uhr vergeben wird, ist um 9 Uhr so oft mergebar, dass es sich wie eine stillstehende Fabrik anfühlt, die Nachtschicht nicht einzuplanen.

Umgebungs-Setup, flaky Tests und Zugangsdaten-Verkabelung — die langweiligen Fehlerquellen, die 2025 unbeaufsichtigte Läufe zerlegt haben — werden größtenteils wegkonstruiert statt wegmodelliert.

Was wahr werden muss

Unbeaufsichtigte Läufe von 8 Stunden oder mehr gelingen bei der Mehrheit der Routine-Tickets, ohne dass ein Mensch sie entblockt.

2027

Die ersten F4-Teams

Prognose

Die ersten Teams, kleine, liefern mehrheitlich von Agenten geschriebenen Code aus, ohne jede Zeile zu lesen, und ihre Fehlerraten halten. Nichts Mystisches dahinter: Review-Schichten, Canaries, schnelles Rollback und die Gewohnheit, Spezifikationen statt Code zu schreiben.

Alle streiten darüber, ob sich das verallgemeinern lässt. Genau dieser Streit ist das Zeichen, dass die Stufe erreicht wurde.

Was wahr werden muss

Mindestens ein Team, das wir benennen können, unseres eingeschlossen, besteht ein ganzes Quartal lang jedes F4-Kriterium und veröffentlicht die Zahlen.

Ausblick: F5 ist keine kurzfristige Behauptung

Wir prognostizieren für 2026 oder 2027 kein vollständig autonomes Fahren. Die ehrlichen Unbekannten: ob Agenten-Review gegen bösartige Komplexität standhält, ob Spezifikation das Lesen von Code als Vertrauensanker im großen Maßstab ersetzen kann und ob die Rechenökonomie die Nachtschicht billiger hält als die Menschen, die sie ergänzt. F5 ist ein Rubrikeintrag, damit wir es erkennen, wenn wir es sehen — kein Versprechen.

Der Scorecard

Wo die Branche wirklich steht

Unsere Einschätzung im August 2026, basierend auf unserem eigenen Team und den Teams, die wir genau beobachten. F3 ist größtenteils offen. F4 ist größtenteils geschlossen. Diese Lücke ist die Arbeit.

F3

Routine-Tickets ohne Eingriff mitten in der Aufgabe

Standard für gut abgegrenzte Arbeit in isolierten Arbeitsbereichen.

Offen
F3

3+ parallele Arbeitsstränge pro Ingenieur

Tägliche Praxis bei unserem Team und unseren intensivsten Nutzern.

Offen
F3

Mehrheit ohne Nachbearbeitung bei gemergten Agenten-PRs

Gilt für Routinearbeit, noch nicht für knifflige Refactorings.

Teilweise
F4

Die Hälfte der gemergten Änderungen ist Agenten-Code ohne Nachbearbeitung

Menschen bearbeiten oder steuern die meisten gemergten Diffs weiterhin stark.

Geschlossen
F4

Agenten-Review auf Augenhöhe mit menschlichem Review

Agenten-Review findet echte Bugs, wird allein aber noch nicht vertraut.

Geschlossen
F4

10+ parallele Arbeitsstränge ohne Kontrollverlust

An guten Tagen möglich. Der Aufwand für Aufsicht wächst noch zu schnell.

Teilweise
F4

Unbeaufsichtigte Läufe über Nacht, morgens mergebar

Funktioniert, wenn die Umgebungen sauber sind. Umgebungen sind selten sauber.

Teilweise
F4

Ticket bis Produktion unter einem Tag, Median

Review- und CI-Warteschlangen fressen die Gewinne der Agenten auf.

Geschlossen

Die Fabrik braucht eine Halle

Superset ist die Werkbank für den Übergang von F3 zu F4: parallele Agenten in isolierten Arbeitsbereichen, Flotten, die sich wirklich beaufsichtigen lassen, und eine Review-Oberfläche für Code, den du nicht selbst geschrieben hast.