Manual
Casi toda la historia del softwareLas personas escriben cada línea. Las herramientas compilan, analizan y se quejan. El teclado es la fábrica.
- Ninguna. Este es el punto de partida.
Seis niveles de autonomía de la fábrica, las metas que los separan y nuestro pronóstico de hasta dónde llega 2026. Lo escribimos ahora para que puedas calificarnos después.
Las predicciones sobre la IA son baratas porque nadie las comprueba. Esta página es una rúbrica, no una intuición: cada meta de abajo es verdadera o falsa para un equipo real que publica software real. La actualizamos a medida que se abren metas, y no movemos la portería.
F3 · Delegado
2.5/3 F3 · 1/5 F4
2027 · pronóstico
Tomada de cómo se califican los coches autónomos y aplicada a cómo se construye el software. El salto interesante es de F3 a F4: de agentes en los que delegas a una fábrica que diriges.
F3 · you are here
Las personas escriben cada línea. Las herramientas compilan, analizan y se quejan. El teclado es la fábrica.
El autocompletado mejora. Un modelo sugiere los siguientes tokens, pero nada se publica sin que una persona escriba la mayor parte.
Un agente escribe funciones y archivos enteros mientras una persona observa cada paso y aprueba cada comando. Un agente, una persona. Más rápido, pero aún en serie.
El agente se encarga de una tarea desde el ticket hasta el diff. La persona revisa el resultado, no las pulsaciones. La atención pasa de escribir código a especificar el trabajo y juzgarlo. Un ingeniero ejecuta varios agentes a la vez en espacios de trabajo aislados.
Flotas de agentes planifican, implementan, revisan y prueban el trabajo de los demás. Las personas marcan el rumbo, arbitran las excepciones y aportan el criterio. La unidad de atención humana ya no es la pull request. Es la decisión.
Entra un resultado, sale software. Las personas especifican la intención, las restricciones y el presupuesto. La fábrica se planifica sola, publica de forma continua, vigila lo que publicó y se revierte sola. La mayoría de los cambios se fusionan sin intervención humana, y la tasa de incidentes no sube.
En parte registro, en parte apuesta. Las dos primeras entradas ya están ocurriendo. El resto está formulado con la concreción suficiente como para equivocarnos.
Escribir código ya no es donde se van las horas de ingeniería. Leerlo, sí. Los equipos que adoptaron agentes en paralelo en 2025 chocaron antes contra el muro: diez agentes producen más diffs antes de comer de los que un equipo puede revisar con honestidad para el viernes.
La respuesta: los agentes revisan a los agentes, y las personas hacen muestreos en lugar de leerlo todo. La confianza se gana de forma estadística, no diff a diff.
Los agentes revisores detectan regresiones plantadas al mismo nivel que los revisores humanos medios en pruebas ciegas.
La descripción del puesto cambia. Los ingenieros dejan de ser mecanógrafos con criterio y pasan a ser despachadores con criterio: descomponen el trabajo, lo enrutan a flotas y arbitran conflictos entre agentes que tocaron el mismo módulo.
Las herramientas que tratan a los agentes como una flota, y no como una ventana de chat, se convierten en la interfaz por defecto del código.
Una sola persona mantiene 10 o más líneas de trabajo simultáneas, y la resolución de conflictos de fusión entre ramas de agentes también está casi toda automatizada.
La fiabilidad a largo plazo cruza un umbral. El trabajo asignado a las 18:00 se puede fusionar a las 9:00 con la frecuencia suficiente como para que no programar el turno de noche se sienta como dejar una fábrica parada.
La preparación del entorno, las pruebas inestables y la gestión de credenciales, los aburridos modos de fallo que arruinaron las ejecuciones desatendidas en 2025, se resuelven sobre todo con ingeniería, no con modelos.
Las ejecuciones desatendidas de 8 horas o más salen bien en la mayoría de los tickets rutinarios sin que nadie las desbloquee.
Los primeros equipos, pequeños, publican código mayoritariamente escrito por agentes sin leer cada línea, y sus tasas de defectos se mantienen. No hay nada místico detrás: capas de revisión, despliegues canary, reversión rápida y el hábito de escribir especificaciones en lugar de código.
Todo el mundo discute si esto se generaliza. Esa discusión es la señal de que se alcanzó el nivel.
Al menos un equipo al que podamos nombrar, incluido el nuestro, supera todas las metas de F4 durante un trimestre completo y publica las cifras.
No pronosticamos autonomía total en 2026 ni en 2027. Las incógnitas honestas: si la revisión por agentes aguanta frente a una complejidad adversaria, si la especificación puede sustituir a la lectura de código como ancla de confianza a gran escala, y si la economía del cómputo mantiene el turno de noche más barato que las personas a las que asiste. F5 es una entrada de la rúbrica para reconocerlo cuando lo veamos, no una promesa.
Nuestra lectura a agosto de 2026, basada en nuestro propio equipo y en los equipos que seguimos de cerca. F3 está casi todo abierto. F4 está casi todo cerrado. Ese hueco es el trabajo.
2 abiertas 3 parciales 3 cerradasde 8 metas de F3 y F4
Tickets rutinarios sin intervención a mitad de la tarea
Habitual en trabajo bien acotado dentro de espacios de trabajo aislados.
3 o más líneas de trabajo simultáneas por ingeniero
Práctica diaria en nuestro equipo y entre nuestros usuarios más intensivos.
Mayoría sin ediciones en las pull requests de agentes fusionadas
Cierto para el trabajo rutinario, todavía no para las refactorizaciones espinosas.
La mitad de los cambios fusionados son código de agentes sin ediciones
Las personas siguen editando o guiando mucho la mayoría de los diffs fusionados.
Revisión por agentes al nivel de la revisión humana
La revisión por agentes detecta errores reales, pero todavía no se confía en ella a solas.
10 o más líneas de trabajo simultáneas sin perder el hilo
Posible en un buen día. El coste de supervisión aún crece demasiado rápido.
Ejecuciones nocturnas desatendidas, fusionables por la mañana
Funciona cuando los entornos están limpios. Los entornos rara vez lo están.
Del ticket a producción en menos de un día, en la mediana
Las colas de revisión y de CI se comen las ganancias que crean los agentes.
Superset es el banco de trabajo para la transición de F3 a F4: agentes en paralelo en espacios de trabajo aislados, flotas que puedes supervisar de verdad y una superficie de revisión para código que no escribiste.