Manuel
L'essentiel de l'histoire du logicielLes humains écrivent chaque ligne. Les outils compilent, analysent et râlent. Le clavier est l'usine.
- Aucune. C'est le point de départ.
Six niveaux d'autonomie de l'usine, les portes qui les séparent, et notre prévision de ce que 2026 nous permettra d'atteindre. Écrit dès maintenant pour que vous puissiez nous noter plus tard.
Les prédictions sur l'IA ne coûtent rien parce que personne ne les vérifie. Cette page est une grille d'évaluation, pas une impression : chaque porte ci-dessous est vraie ou fausse pour une vraie équipe qui livre de vrais logiciels. Nous la mettons à jour à mesure que les portes s'ouvrent, et nous ne déplaçons pas les objectifs en cours de route.
F3 · Délégué
2.5/3 F3 · 1/5 F4
2027 · prévision
Empruntée à la façon dont on note les voitures autonomes, appliquée à la façon dont on fabrique du logiciel. Le saut intéressant est F3 vers F4 : des agents à qui l'on délègue à une usine que l'on dirige.
F3 · you are here
Les humains écrivent chaque ligne. Les outils compilent, analysent et râlent. Le clavier est l'usine.
L'autocomplétion devient bonne. Un modèle suggère les quelques tokens suivants, mais rien n'est livré sans qu'un humain en tape l'essentiel.
Un agent écrit des fonctions et des fichiers entiers pendant qu'un humain surveille chaque étape et approuve chaque commande. Un agent, un humain. Plus rapide, mais toujours en série.
L'agent prend en charge une tâche du ticket au diff. L'humain relit le résultat, pas les frappes au clavier. L'attention passe de l'écriture du code à la spécification du travail et à son évaluation. Un ingénieur fait tourner plusieurs agents à la fois dans des espaces de travail isolés.
Des flottes d'agents planifient, implémentent, relisent et testent le travail des autres. Les humains fixent le cap, arbitrent les exceptions et portent le goût. L'unité d'attention humaine n'est plus la pull request. C'est la décision.
Un résultat en entrée, du logiciel en sortie. Les humains précisent l'intention, les contraintes et le budget. L'usine se planifie elle-même, livre en continu, surveille ce qu'elle a livré et revient elle-même en arrière. La plupart des changements sont fusionnés sans humain dans la boucle, et le taux d'incidents n'augmente pas.
Mi-constat, mi-pari. Les deux premières entrées se produisent déjà. Le reste est formulé assez concrètement pour qu'on puisse s'y tromper.
Écrire du code n'est plus là où passent les heures d'ingénierie. Le lire, si. Les équipes qui ont adopté les agents en parallèle en 2025 ont heurté le mur les premières : dix agents produisent avant midi plus de diffs qu'une équipe ne peut honnêtement en relire d'ici vendredi.
La réponse : les agents relisent les agents, et les humains échantillonnent au lieu de tout lire. La confiance se gagne statistiquement, pas diff par diff.
Les agents relecteurs détectent des régressions plantées à parité avec un relecteur humain médian, en test à l'aveugle.
La fiche de poste change. Les ingénieurs cessent d'être des dactylos avec du goût pour devenir des répartiteurs avec du goût : découper le travail, l'acheminer vers des flottes, arbitrer les conflits entre agents qui ont touché le même module.
Les outils qui traitent les agents comme une flotte, et non comme une fenêtre de chat, deviennent l'interface par défaut vers le code.
Un ingénieur tient 10 chantiers simultanés ou plus, et la résolution des conflits de fusion entre branches d'agents est elle-même largement automatisée.
La fiabilité sur longue durée franchit un seuil. Le travail confié à 18 h est fusionnable à 9 h assez souvent pour que ne pas programmer l'équipe de nuit revienne à laisser une usine à l'arrêt.
La préparation des environnements, les tests instables et la plomberie des identifiants — les modes d'échec ennuyeux qui tuaient les exécutions sans surveillance en 2025 — sont surtout réglés par l'ingénierie, pas par les modèles.
Des exécutions sans surveillance de 8 heures ou plus réussissent sur la majorité des tickets courants, sans qu'un humain les débloque.
Les premières équipes, de petite taille, livrent du code majoritairement écrit par des agents sans en lire chaque ligne, et leur taux de défauts tient. Rien de mystique derrière : des couches de revue, des canaries, un rollback rapide et l'habitude d'écrire des spécifications plutôt que du code.
Tout le monde débat de savoir si cela se généralise. Ce débat est le signe que le niveau est atteint.
Au moins une équipe identifiable, la nôtre comprise, passe toutes les portes F4 pendant un trimestre entier et publie ses chiffres.
Nous ne prévoyons pas d'autonomie complète en 2026 ni en 2027. Les vraies inconnues : la revue par agents tiendra-t-elle face à une complexité adverse, la spécification pourra-t-elle remplacer la lecture du code comme ancrage de confiance à grande échelle, et l'économie du calcul gardera-t-elle l'équipe de nuit moins chère que les humains qu'elle épaule. F5 est une entrée de grille pour le reconnaître le jour venu, pas une promesse.
Notre lecture en août 2026, à partir de notre propre équipe et des équipes que nous suivons de près. F3 est majoritairement ouvert. F4 est majoritairement fermé. Cet écart, c'est le travail à faire.
2 ouvertes 3 partielles 3 ferméessur 8 portes F3 et F4
Tickets courants sans intervention en cours de tâche
La norme pour un travail bien cadré dans des espaces de travail isolés.
3 chantiers simultanés ou plus par ingénieur
Pratique quotidienne pour notre équipe et nos utilisateurs les plus intensifs.
Majorité sans retouche sur les PR d'agents fusionnées
Vrai pour le travail courant, pas encore pour les refactorisations épineuses.
La moitié des changements fusionnés sont du code d'agent sans retouche
Les humains retouchent ou orientent encore fortement la plupart des diffs fusionnés.
Revue par les agents à parité avec la revue humaine
La revue par les agents détecte de vrais bugs, mais on ne lui fait pas encore confiance seule.
10 chantiers simultanés ou plus sans perte d'état
Possible les bons jours. Le coût de supervision croît encore trop vite.
Exécutions de nuit sans surveillance, fusionnables au matin
Fonctionne quand les environnements sont propres. Ils le sont rarement.
Du ticket à la production en moins d'un jour, en médiane
Les files d'attente de revue et de CI absorbent les gains créés par les agents.
Superset est l'établi de la transition F3 vers F4 : des agents en parallèle dans des espaces de travail isolés, des flottes réellement supervisables et une surface de revue pour du code que vous n'avez pas écrit.