Manuale
Quasi tutta la storia del softwareGli umani scrivono ogni riga. Gli strumenti compilano, fanno lint e si lamentano. La tastiera è la fabbrica.
- Nessuno. Questo è il punto di partenza.
Sei livelli di autonomia della fabbrica, i gate tra di essi e la nostra previsione su quanto lontano ci porterà il 2026. Messo per iscritto ora, così potrai valutarci dopo.
Le previsioni sull'AI costano poco perché nessuno le verifica. Questa pagina è una griglia di valutazione, non una sensazione: ogni gate qui sotto è vero o falso per un team reale che rilascia software reale. La aggiorniamo man mano che i gate si aprono e non spostiamo i pali della porta.
F3 · Delegato
2.5/3 F3 · 1/5 F4
2027 · previsione
Presa in prestito da come si valutano le auto a guida autonoma, applicata a come si costruisce il software. Il salto interessante è da F3 a F4: dagli agenti a cui deleghi a una fabbrica che dirigi.
F3 · you are here
Gli umani scrivono ogni riga. Gli strumenti compilano, fanno lint e si lamentano. La tastiera è la fabbrica.
L'autocompletamento diventa buono. Un modello suggerisce i token successivi, ma non si rilascia nulla senza che un umano ne digiti la maggior parte.
Un agente scrive intere funzioni e interi file mentre un umano osserva ogni passaggio e approva ogni comando. Un agente, un umano. Più veloce, ma ancora seriale.
L'agente prende in carico un task dal ticket al diff. L'umano rivede il risultato, non le battute sulla tastiera. L'attenzione si sposta dallo scrivere codice allo specificare il lavoro e giudicarlo. Un ingegnere fa girare diversi agenti insieme in workspace isolati.
Flotte di agenti pianificano, implementano, rivedono e testano il lavoro l'una dell'altra. Gli umani danno la direzione, arbitrano le eccezioni e sono responsabili del gusto. L'unità dell'attenzione umana non è più la pull request. È la decisione.
Entra un obiettivo, esce del software. Gli umani specificano intento, vincoli e budget. La fabbrica si programma da sola, rilascia in continuo, monitora ciò che ha rilasciato e torna indietro da sola. La maggior parte delle modifiche viene unita senza un umano nel ciclo, e il tasso di incidenti non sale.
In parte cronaca, in parte scommessa. Le prime due voci stanno già accadendo. Il resto è formulato in modo abbastanza concreto da poter risultare sbagliato.
Scrivere codice non è più dove vanno le ore degli ingegneri. Leggerlo sì. I team che hanno adottato gli agenti in parallelo nel 2025 hanno sbattuto per primi contro il muro: dieci agenti possono produrre più diff prima di pranzo di quanti un team ne possa rivedere onestamente entro venerdì.
La risposta: gli agenti rivedono gli agenti e gli umani campionano invece di leggere tutto. La fiducia si guadagna statisticamente, non diff per diff.
I revisori agenti individuano le regressioni piantate alla pari con i revisori umani mediani in test alla cieca.
La descrizione del lavoro cambia. Gli ingegneri smettono di essere dattilografi con gusto e diventano dispatcher con gusto: scompongono il lavoro, lo instradano alle flotte, arbitrano i conflitti tra agenti che hanno toccato lo stesso modulo.
Gli strumenti che trattano gli agenti come una flotta, non come una finestra di chat, diventano l'interfaccia predefinita verso il codice.
Un ingegnere sostiene 10 o più flussi di lavoro simultanei, e la risoluzione dei conflitti di merge tra i branch degli agenti è essa stessa in gran parte automatizzata.
L'affidabilità sul lungo periodo supera una soglia. Il lavoro assegnato alle 18 è pronto per il merge alle 9 abbastanza spesso che non programmare il turno di notte sembra lasciare una fabbrica ferma.
La preparazione dell'ambiente, i test instabili e la gestione delle credenziali, le noiose cause di fallimento che uccidevano le esecuzioni non presidiate nel 2025, vengono per lo più risolte con l'ingegneria più che con i modelli.
Esecuzioni non presidiate di 8 ore o più riescono sulla maggior parte dei ticket di routine senza che un umano le sblocchi.
I primi team, piccoli, rilasciano codice scritto in maggioranza dagli agenti senza leggere ogni riga, e i loro tassi di difetti tengono. Niente di mistico dietro: livelli di revisione, canary, rollback rapidi e l'abitudine di scrivere specifiche invece di codice.
Tutti discutono se questo sia generalizzabile. Quella discussione è il segno che il livello è stato raggiunto.
Almeno un team di cui possiamo fare il nome, incluso il nostro, supera tutti i gate F4 per un intero trimestre e pubblica i numeri.
Non prevediamo la guida completamente autonoma nel 2026 o nel 2027. Le incognite oneste: se la revisione fatta dagli agenti regga di fronte a una complessità avversa, se la specifica possa sostituire la lettura del codice come ancora della fiducia su larga scala, e se l'economia del calcolo mantenga il turno di notte più economico delle persone che potenzia. F5 è una voce della griglia per riconoscerlo quando lo vedremo, non una promessa.
La nostra lettura ad agosto 2026, basata sul nostro team e sui team che seguiamo da vicino. F3 è quasi tutto aperto. F4 è quasi tutto chiuso. Quel divario è il lavoro da fare.
2 aperti 3 parziali 3 chiusisu 8 gate F3 e F4
Ticket di routine senza interventi a metà task
Standard per il lavoro ben delimitato in workspace isolati.
3+ flussi di lavoro simultanei per ingegnere
Pratica quotidiana per il nostro team e per i nostri utenti più intensi.
Maggioranza senza modifiche sulle PR degli agenti unite
Vero per il lavoro di routine, non ancora per i refactor complicati.
Metà delle modifiche unite è codice degli agenti senza modifiche
Gli umani modificano ancora o guidano pesantemente la maggior parte dei diff uniti.
Revisione degli agenti alla pari con quella umana
La revisione degli agenti trova bug reali ma non è ancora affidabile da sola.
10+ flussi di lavoro simultanei senza perdere il filo
Possibile nelle giornate buone. Il costo della supervisione cresce ancora troppo in fretta.
Esecuzioni notturne non presidiate, pronte per il merge la mattina
Funziona quando gli ambienti sono puliti. Gli ambienti sono raramente puliti.
Dal ticket alla produzione in meno di un giorno, mediana
Le code di revisione e di CI si mangiano i guadagni creati dagli agenti.
Superset è il banco di lavoro per la transizione da F3 a F4: agenti in parallelo in workspace isolati, flotte che puoi davvero supervisionare e una superficie di revisione per il codice che non hai scritto.