Previsione · Pubblicato ad agosto 2026

La fabbrica di software a guida autonoma

Sei livelli di autonomia della fabbrica, i gate tra di essi e la nostra previsione su quanto lontano ci porterà il 2026. Messo per iscritto ora, così potrai valutarci dopo.

Le previsioni sull'AI costano poco perché nessuno le verifica. Questa pagina è una griglia di valutazione, non una sensazione: ogni gate qui sotto è vero o falso per un team reale che rilascia software reale. La aggiorniamo man mano che i gate si aprono e non spostiamo i pali della porta.

La griglia

Sei livelli di autonomia della fabbrica

Presa in prestito da come si valutano le auto a guida autonoma, applicata a come si costruisce il software. Il salto interessante è da F3 a F4: dagli agenti a cui deleghi a una fabbrica che dirigi.

Fig. 1 · Human share of the effort behind a merged changeSchematic, by autonomy level. Hover for values.
0%50%100%100%F0F1F235%F3F42%F5

F3 · you are here

F0

Manuale

Quasi tutta la storia del software

Gli umani scrivono ogni riga. Gli strumenti compilano, fanno lint e si lamentano. La tastiera è la fabbrica.

Gate
  • Nessuno. Questo è il punto di partenza.
F1

Assistito

Dal 2021 al 2023

L'autocompletamento diventa buono. Un modello suggerisce i token successivi, ma non si rilascia nulla senza che un umano ne digiti la maggior parte.

Gate
  • Il codice suggerito dal modello compare nella maggioranza dei nuovi file.
  • Nessuno rivede in modo diverso per questo.
F2

Supervisionato

2024

Un agente scrive intere funzioni e interi file mentre un umano osserva ogni passaggio e approva ogni comando. Un agente, un umano. Più veloce, ma ancora seriale.

Gate
  • Un agente completa modifiche su più file dall'inizio alla fine.
  • L'umano legge ogni riga prima del merge.
  • Un umano guida al massimo un agente alla volta.
F3

Delegato

Dal 2025 a oggiDove sono i team seri

L'agente prende in carico un task dal ticket al diff. L'umano rivede il risultato, non le battute sulla tastiera. L'attenzione si sposta dallo scrivere codice allo specificare il lavoro e giudicarlo. Un ingegnere fa girare diversi agenti insieme in workspace isolati.

F4

Orchestrato

La scommessa del 2026La fabbrica

Flotte di agenti pianificano, implementano, rivedono e testano il lavoro l'una dell'altra. Gli umani danno la direzione, arbitrano le eccezioni e sono responsabili del gusto. L'unità dell'attenzione umana non è più la pull request. È la decisione.

F5

Autonomo

Non una previsione per il 2026Guida completamente autonoma

Entra un obiettivo, esce del software. Gli umani specificano intento, vincoli e budget. La fabbrica si programma da sola, rilascia in continuo, monitora ciò che ha rilasciato e torna indietro da sola. La maggior parte delle modifiche viene unita senza un umano nel ciclo, e il tasso di incidenti non sale.

Gate
  • La maggior parte delle modifiche in produzione viene unita senza che nessun umano legga il diff.
  • Tasso di fallimento delle modifiche pari o inferiore alla linea di base dell'era umana per due trimestri consecutivi.
  • La fabbrica annulla i propri deploy sbagliati più in fretta di quanto facesse un umano di turno.
  • Gli umani nel ciclo ci sono per le decisioni di giudizio, non per la produttività.
La previsione

Come andrà il 2026

In parte cronaca, in parte scommessa. Le prime due voci stanno già accadendo. Il resto è formulato in modo abbastanza concreto da poter risultare sbagliato.

Fig. 2 · Merged changes written by agents, zero human editsIndustry median, our estimate. Dashed is forecast. The first F4 teams cross the gate earlier.
0%25%50%20242025202620272028F4 gate · 50%TODAY
Inizio 2026

La revisione diventa il collo di bottiglia

Accaduto

Scrivere codice non è più dove vanno le ore degli ingegneri. Leggerlo sì. I team che hanno adottato gli agenti in parallelo nel 2025 hanno sbattuto per primi contro il muro: dieci agenti possono produrre più diff prima di pranzo di quanti un team ne possa rivedere onestamente entro venerdì.

La risposta: gli agenti rivedono gli agenti e gli umani campionano invece di leggere tutto. La fiducia si guadagna statisticamente, non diff per diff.

Cosa deve diventare vero

I revisori agenti individuano le regressioni piantate alla pari con i revisori umani mediani in test alla cieca.

Metà 2026

Compare il dispatcher

In corso

La descrizione del lavoro cambia. Gli ingegneri smettono di essere dattilografi con gusto e diventano dispatcher con gusto: scompongono il lavoro, lo instradano alle flotte, arbitrano i conflitti tra agenti che hanno toccato lo stesso modulo.

Gli strumenti che trattano gli agenti come una flotta, non come una finestra di chat, diventano l'interfaccia predefinita verso il codice.

Cosa deve diventare vero

Un ingegnere sostiene 10 o più flussi di lavoro simultanei, e la risoluzione dei conflitti di merge tra i branch degli agenti è essa stessa in gran parte automatizzata.

Fine 2026

Il turno di notte

Previsione

L'affidabilità sul lungo periodo supera una soglia. Il lavoro assegnato alle 18 è pronto per il merge alle 9 abbastanza spesso che non programmare il turno di notte sembra lasciare una fabbrica ferma.

La preparazione dell'ambiente, i test instabili e la gestione delle credenziali, le noiose cause di fallimento che uccidevano le esecuzioni non presidiate nel 2025, vengono per lo più risolte con l'ingegneria più che con i modelli.

Cosa deve diventare vero

Esecuzioni non presidiate di 8 ore o più riescono sulla maggior parte dei ticket di routine senza che un umano le sblocchi.

2027

I primi team F4

Previsione

I primi team, piccoli, rilasciano codice scritto in maggioranza dagli agenti senza leggere ogni riga, e i loro tassi di difetti tengono. Niente di mistico dietro: livelli di revisione, canary, rollback rapidi e l'abitudine di scrivere specifiche invece di codice.

Tutti discutono se questo sia generalizzabile. Quella discussione è il segno che il livello è stato raggiunto.

Cosa deve diventare vero

Almeno un team di cui possiamo fare il nome, incluso il nostro, supera tutti i gate F4 per un intero trimestre e pubblica i numeri.

Oltre: F5 non è una previsione a breve termine

Non prevediamo la guida completamente autonoma nel 2026 o nel 2027. Le incognite oneste: se la revisione fatta dagli agenti regga di fronte a una complessità avversa, se la specifica possa sostituire la lettura del codice come ancora della fiducia su larga scala, e se l'economia del calcolo mantenga il turno di notte più economico delle persone che potenzia. F5 è una voce della griglia per riconoscerlo quando lo vedremo, non una promessa.

La scheda di valutazione

Dov'è il settore, onestamente

La nostra lettura ad agosto 2026, basata sul nostro team e sui team che seguiamo da vicino. F3 è quasi tutto aperto. F4 è quasi tutto chiuso. Quel divario è il lavoro da fare.

F3

Ticket di routine senza interventi a metà task

Standard per il lavoro ben delimitato in workspace isolati.

Aperto
F3

3+ flussi di lavoro simultanei per ingegnere

Pratica quotidiana per il nostro team e per i nostri utenti più intensi.

Aperto
F3

Maggioranza senza modifiche sulle PR degli agenti unite

Vero per il lavoro di routine, non ancora per i refactor complicati.

Parziale
F4

Metà delle modifiche unite è codice degli agenti senza modifiche

Gli umani modificano ancora o guidano pesantemente la maggior parte dei diff uniti.

Chiuso
F4

Revisione degli agenti alla pari con quella umana

La revisione degli agenti trova bug reali ma non è ancora affidabile da sola.

Chiuso
F4

10+ flussi di lavoro simultanei senza perdere il filo

Possibile nelle giornate buone. Il costo della supervisione cresce ancora troppo in fretta.

Parziale
F4

Esecuzioni notturne non presidiate, pronte per il merge la mattina

Funziona quando gli ambienti sono puliti. Gli ambienti sono raramente puliti.

Parziale
F4

Dal ticket alla produzione in meno di un giorno, mediana

Le code di revisione e di CI si mangiano i guadagni creati dagli agenti.

Chiuso

La fabbrica ha bisogno di un piano di lavoro

Superset è il banco di lavoro per la transizione da F3 a F4: agenti in parallelo in workspace isolati, flotte che puoi davvero supervisionare e una superficie di revisione per il codice che non hai scritto.