Voorspelling · Gepubliceerd augustus 2026

De zelfrijdende softwarefabriek

Zes niveaus van fabrieksautonomie, de drempels ertussen, en onze voorspelling van hoe ver 2026 ons brengt. Nu opgeschreven zodat je ons later kunt beoordelen.

Voorspellingen over AI zijn goedkoop omdat niemand ze narekent. Deze pagina is een rubric, geen gevoel: elke drempel hieronder is waar of onwaar voor een echt team dat echte software levert. We werken de pagina bij als drempels vallen, en we verzetten de doelpalen niet.

De rubric

Zes niveaus van fabrieksautonomie

Geleend van hoe zelfrijdende auto's worden beoordeeld, toegepast op hoe software wordt gebouwd. De interessante sprong is F3 naar F4: van agents waaraan je delegeert naar een fabriek die je aanstuurt.

Fig. 1 · Human share of the effort behind a merged changeSchematic, by autonomy level. Hover for values.
0%50%100%100%F0F1F235%F3F42%F5

F3 · you are here

F0

Handmatig

Het grootste deel van de softwaregeschiedenis

Mensen schrijven elke regel. Tools compileren, linten en klagen. Het toetsenbord is de fabriek.

Drempels
  • Geen. Dit is de bodem.
F1

Ondersteund

2021 tot 2023

Autocomplete wordt goed. Een model stelt de volgende tokens voor, maar er gaat niets live zonder dat een mens het meeste typt.

Drempels
  • Door een model voorgestelde code staat in een meerderheid van de nieuwe bestanden.
  • Niemand reviewt er anders door.
F2

Begeleid

2024

Een agent schrijft hele functies en bestanden terwijl een mens elke stap volgt en elk commando goedkeurt. Eén agent, één mens. Sneller, maar nog steeds serieel.

Drempels
  • Een agent voltooit wijzigingen over meerdere bestanden van begin tot eind.
  • De mens leest elke regel voordat het merget.
  • Eén mens stuurt hoogstens één agent tegelijk aan.
F3

Gedelegeerd

2025 tot nuWaar serieuze teams staan

De agent bezit een taak van ticket tot diff. De mens reviewt het resultaat, niet de toetsaanslagen. De aandacht verschuift van code schrijven naar werk specificeren en beoordelen. Eén engineer laat meerdere agents tegelijk draaien in geïsoleerde werkruimtes.

F4

Georkestreerd

De weddenschap voor 2026De fabriek

Vloten van agents plannen, bouwen, reviewen en testen elkaars werk. Mensen bepalen de richting, beslechten uitzonderingen en bewaken de smaak. De eenheid van menselijke aandacht is niet langer de pull request. Het is de beslissing.

F5

Autonoom

Geen claim voor 2026Volledig zelfrijdend

Uitkomst erin, software eruit. Mensen specificeren intentie, randvoorwaarden en budget. De fabriek plant zichzelf, levert continu, monitort wat ze opleverde en rolt zichzelf terug. De meeste wijzigingen mergen zonder mens in de lus, en het aantal incidenten stijgt niet.

Drempels
  • Een meerderheid van de productiewijzigingen merget zonder dat een mens de diff leest.
  • Het percentage mislukte wijzigingen ligt twee kwartalen op rij op of onder het niveau van het menselijke tijdperk.
  • De fabriek draait haar eigen slechte deploys sneller terug dan een menselijke oproepdienst dat deed.
  • Mensen in de lus zitten er voor de afwegingen, niet voor de doorvoer.
De voorspelling

Hoe 2026 verloopt

Deels verslag, deels weddenschap. De eerste twee punten gebeuren al. De rest staat concreet genoeg om ongelijk over te krijgen.

Fig. 2 · Merged changes written by agents, zero human editsIndustry median, our estimate. Dashed is forecast. The first F4 teams cross the gate earlier.
0%25%50%20242025202620272028F4 gate · 50%TODAY
Begin 2026

Review wordt het knelpunt

Gebeurd

Code schrijven is niet meer waar de uren van engineers heen gaan. Code lezen wel. Teams die in 2025 parallelle agents omarmden, liepen als eerste tegen de muur: tien agents produceren voor de lunch meer diffs dan een team eerlijk kan reviewen vóór vrijdag.

Het antwoord: agents reviewen agents, en mensen nemen steekproeven in plaats van alles te lezen. Vertrouwen wordt statistisch verdiend, niet per diff.

Wat waar moet worden

Agentreviewers vangen geplante regressies even goed op als de mediane menselijke reviewer in blinde tests.

Medio 2026

De dispatcher verschijnt

Gaande

De functieomschrijving verschuift. Engineers zijn geen typisten met smaak meer, maar dispatchers met smaak: werk opdelen, het naar vloten routeren, en conflicten beslechten tussen agents die dezelfde module aanraakten.

Tools die agents als een vloot behandelen in plaats van als een chatvenster worden de standaardinterface naar de codebase.

Wat waar moet worden

Eén engineer houdt 10 of meer gelijktijdige werkstromen draaiende, en het oplossen van merge-conflicten tussen agentbranches is zelf grotendeels geautomatiseerd.

Eind 2026

De nachtploeg

Voorspelling

Betrouwbaarheid over lange horizon overschrijdt een drempel. Werk dat om 18.00 uur wordt toegewezen is om 9.00 uur zo vaak mergebaar dat het niet inplannen van de nachtploeg voelt als een fabriek stil laten staan.

Omgevingsopzet, flaky tests en credential-geknutsel — de saaie faalvormen die onbewaakte runs in 2025 om zeep hielpen — zijn grotendeels weggewerkt met engineering in plaats van met modellen.

Wat waar moet worden

Onbewaakte runs van 8 uur of langer slagen bij een meerderheid van de routinetickets zonder dat een mens ze vlottrekt.

2027

De eerste F4-teams

Voorspelling

De eerste teams, kleine, leveren code die grotendeels door agents is geschreven zonder elke regel te lezen, en hun defectpercentages houden stand. Niets mystieks erachter: reviewlagen, canaries, snelle rollback en de gewoonte om specificaties te schrijven in plaats van code.

Iedereen discussieert over de vraag of dit generaliseert. Die discussie is het teken dat het niveau is bereikt.

Wat waar moet worden

Minstens één team dat we kunnen noemen, het onze inbegrepen, haalt een heel kwartaal lang elke F4-drempel en publiceert de cijfers.

Verder: F5 is geen claim voor de korte termijn

We voorspellen geen volledige zelfsturing in 2026 of 2027. De eerlijke onbekenden: of agentreview standhoudt tegen vijandige complexiteit, of specificatie op schaal het lezen van code kan vervangen als vertrouwensanker, en of de rekeneconomie de nachtploeg goedkoper houdt dan de mensen die zij aanvult. F5 staat in de rubric zodat we het herkennen als we het zien, niet als belofte.

De scorekaart

Waar de sector staat, eerlijk gezegd

Onze inschatting per augustus 2026, op basis van ons eigen team en de teams die we van dichtbij volgen. F3 staat grotendeels open. F4 staat grotendeels dicht. Dat gat is het werk.

F3

Routinetickets zonder tussentijds ingrijpen

Standaard voor goed afgebakend werk in geïsoleerde werkruimtes.

Open
F3

3+ gelijktijdige werkstromen per engineer

Dagelijkse praktijk voor ons team en onze zwaarste gebruikers.

Open
F3

Meerderheid van gemergede agent-PR's zonder bewerkingen

Waar voor routinewerk, nog niet voor lastige refactors.

Gedeeltelijk
F4

Helft van de gemergede wijzigingen is agentcode zonder bewerkingen

Mensen bewerken of sturen de meeste gemergede diffs nog stevig bij.

Gesloten
F4

Agentreview op gelijk niveau met menselijke review

Agentreview vangt echte bugs, maar wordt nog niet alleen vertrouwd.

Gesloten
F4

10+ gelijktijdige werkstromen zonder verlies van context

Mogelijk op goede dagen. De kosten van toezicht groeien nog te snel.

Gedeeltelijk
F4

Onbewaakte nachtruns, 's ochtends mergebaar

Werkt als omgevingen schoon zijn. Omgevingen zijn zelden schoon.

Gedeeltelijk
F4

Ticket tot productie onder één dag, mediaan

Review- en CI-wachtrijen eten de winst op die agents opleveren.

Gesloten

De fabriek heeft een werkvloer nodig

Superset is de werkbank voor de overgang van F3 naar F4: parallelle agents in geïsoleerde werkruimtes, vloten die je echt kunt overzien, en een reviewoppervlak voor code die je niet zelf schreef.