Handmatig
Het grootste deel van de softwaregeschiedenisMensen schrijven elke regel. Tools compileren, linten en klagen. Het toetsenbord is de fabriek.
- Geen. Dit is de bodem.
Zes niveaus van fabrieksautonomie, de drempels ertussen, en onze voorspelling van hoe ver 2026 ons brengt. Nu opgeschreven zodat je ons later kunt beoordelen.
Voorspellingen over AI zijn goedkoop omdat niemand ze narekent. Deze pagina is een rubric, geen gevoel: elke drempel hieronder is waar of onwaar voor een echt team dat echte software levert. We werken de pagina bij als drempels vallen, en we verzetten de doelpalen niet.
F3 · Gedelegeerd
2.5/3 F3 · 1/5 F4
2027 · voorspelling
Geleend van hoe zelfrijdende auto's worden beoordeeld, toegepast op hoe software wordt gebouwd. De interessante sprong is F3 naar F4: van agents waaraan je delegeert naar een fabriek die je aanstuurt.
F3 · you are here
Mensen schrijven elke regel. Tools compileren, linten en klagen. Het toetsenbord is de fabriek.
Autocomplete wordt goed. Een model stelt de volgende tokens voor, maar er gaat niets live zonder dat een mens het meeste typt.
Een agent schrijft hele functies en bestanden terwijl een mens elke stap volgt en elk commando goedkeurt. Eén agent, één mens. Sneller, maar nog steeds serieel.
De agent bezit een taak van ticket tot diff. De mens reviewt het resultaat, niet de toetsaanslagen. De aandacht verschuift van code schrijven naar werk specificeren en beoordelen. Eén engineer laat meerdere agents tegelijk draaien in geïsoleerde werkruimtes.
Vloten van agents plannen, bouwen, reviewen en testen elkaars werk. Mensen bepalen de richting, beslechten uitzonderingen en bewaken de smaak. De eenheid van menselijke aandacht is niet langer de pull request. Het is de beslissing.
Uitkomst erin, software eruit. Mensen specificeren intentie, randvoorwaarden en budget. De fabriek plant zichzelf, levert continu, monitort wat ze opleverde en rolt zichzelf terug. De meeste wijzigingen mergen zonder mens in de lus, en het aantal incidenten stijgt niet.
Deels verslag, deels weddenschap. De eerste twee punten gebeuren al. De rest staat concreet genoeg om ongelijk over te krijgen.
Code schrijven is niet meer waar de uren van engineers heen gaan. Code lezen wel. Teams die in 2025 parallelle agents omarmden, liepen als eerste tegen de muur: tien agents produceren voor de lunch meer diffs dan een team eerlijk kan reviewen vóór vrijdag.
Het antwoord: agents reviewen agents, en mensen nemen steekproeven in plaats van alles te lezen. Vertrouwen wordt statistisch verdiend, niet per diff.
Agentreviewers vangen geplante regressies even goed op als de mediane menselijke reviewer in blinde tests.
De functieomschrijving verschuift. Engineers zijn geen typisten met smaak meer, maar dispatchers met smaak: werk opdelen, het naar vloten routeren, en conflicten beslechten tussen agents die dezelfde module aanraakten.
Tools die agents als een vloot behandelen in plaats van als een chatvenster worden de standaardinterface naar de codebase.
Eén engineer houdt 10 of meer gelijktijdige werkstromen draaiende, en het oplossen van merge-conflicten tussen agentbranches is zelf grotendeels geautomatiseerd.
Betrouwbaarheid over lange horizon overschrijdt een drempel. Werk dat om 18.00 uur wordt toegewezen is om 9.00 uur zo vaak mergebaar dat het niet inplannen van de nachtploeg voelt als een fabriek stil laten staan.
Omgevingsopzet, flaky tests en credential-geknutsel — de saaie faalvormen die onbewaakte runs in 2025 om zeep hielpen — zijn grotendeels weggewerkt met engineering in plaats van met modellen.
Onbewaakte runs van 8 uur of langer slagen bij een meerderheid van de routinetickets zonder dat een mens ze vlottrekt.
De eerste teams, kleine, leveren code die grotendeels door agents is geschreven zonder elke regel te lezen, en hun defectpercentages houden stand. Niets mystieks erachter: reviewlagen, canaries, snelle rollback en de gewoonte om specificaties te schrijven in plaats van code.
Iedereen discussieert over de vraag of dit generaliseert. Die discussie is het teken dat het niveau is bereikt.
Minstens één team dat we kunnen noemen, het onze inbegrepen, haalt een heel kwartaal lang elke F4-drempel en publiceert de cijfers.
We voorspellen geen volledige zelfsturing in 2026 of 2027. De eerlijke onbekenden: of agentreview standhoudt tegen vijandige complexiteit, of specificatie op schaal het lezen van code kan vervangen als vertrouwensanker, en of de rekeneconomie de nachtploeg goedkoper houdt dan de mensen die zij aanvult. F5 staat in de rubric zodat we het herkennen als we het zien, niet als belofte.
Onze inschatting per augustus 2026, op basis van ons eigen team en de teams die we van dichtbij volgen. F3 staat grotendeels open. F4 staat grotendeels dicht. Dat gat is het werk.
2 open 3 gedeeltelijk 3 geslotenvan 8 F3- en F4-drempels
Routinetickets zonder tussentijds ingrijpen
Standaard voor goed afgebakend werk in geïsoleerde werkruimtes.
3+ gelijktijdige werkstromen per engineer
Dagelijkse praktijk voor ons team en onze zwaarste gebruikers.
Meerderheid van gemergede agent-PR's zonder bewerkingen
Waar voor routinewerk, nog niet voor lastige refactors.
Helft van de gemergede wijzigingen is agentcode zonder bewerkingen
Mensen bewerken of sturen de meeste gemergede diffs nog stevig bij.
Agentreview op gelijk niveau met menselijke review
Agentreview vangt echte bugs, maar wordt nog niet alleen vertrouwd.
10+ gelijktijdige werkstromen zonder verlies van context
Mogelijk op goede dagen. De kosten van toezicht groeien nog te snel.
Onbewaakte nachtruns, 's ochtends mergebaar
Werkt als omgevingen schoon zijn. Omgevingen zijn zelden schoon.
Ticket tot productie onder één dag, mediaan
Review- en CI-wachtrijen eten de winst op die agents opleveren.
Superset is de werkbank voor de overgang van F3 naar F4: parallelle agents in geïsoleerde werkruimtes, vloten die je echt kunt overzien, en een reviewoppervlak voor code die je niet zelf schreef.