Вручную
Почти вся история софтаЛюди пишут каждую строку. Инструменты компилируют, линтуют и жалуются. Клавиатура и есть фабрика.
- Нет. Это нижняя граница.
Шесть уровней автономности фабрики, шлюзы между ними и наш прогноз, как далеко нас заведёт 2026 год. Записано сейчас, чтобы потом вы могли выставить нам оценку.
Предсказания про AI дёшевы, потому что их никто не проверяет. Эта страница — рубрика, а не настроение: каждый шлюз ниже либо истинен, либо ложен для реальной команды, выпускающей реальный софт. Мы обновляем её по мере открытия шлюзов и не двигаем ворота.
F3 · С делегированием
2.5/3 F3 · 1/5 F4
2027 · прогноз
Заимствовано из того, как оценивают беспилотные автомобили, и применено к тому, как делают софт. Интересный скачок — с F3 на F4: от агентов, которым делегируешь, к фабрике, которой управляешь.
F3 · you are here
Люди пишут каждую строку. Инструменты компилируют, линтуют и жалуются. Клавиатура и есть фабрика.
Автодополнение становится хорошим. Модель предлагает следующие несколько токенов, но ничего не выходит без того, чтобы человек напечатал большую часть.
Агент пишет целые функции и файлы, а человек следит за каждым шагом и одобряет каждую команду. Один агент, один человек. Быстрее, но всё ещё последовательно.
Агент ведёт задачу от тикета до diff. Человек проверяет результат, а не нажатия клавиш. Внимание смещается с написания кода на постановку задач и оценку результата. Один инженер ведёт несколько агентов одновременно в изолированных рабочих областях.
Флоты агентов планируют, реализуют, проверяют и тестируют работу друг друга. Люди задают направление, разбирают исключения и отвечают за вкус. Единица человеческого внимания — уже не пул-реквест, а решение.
На входе результат, на выходе софт. Люди задают намерение, ограничения и бюджет. Фабрика сама планирует, непрерывно выпускает, следит за выпущенным и сама откатывается. Большинство изменений сливается без человека в контуре, а частота инцидентов не растёт.
Отчасти хроника, отчасти ставка. Первые два пункта уже происходят. Остальное сформулировано достаточно конкретно, чтобы в нём можно было ошибиться.
Написание кода больше не там, куда уходят инженерные часы. Туда уходит чтение. Команды, перешедшие на параллельных агентов в 2025 году, упёрлись в стену первыми: десять агентов до обеда выдают больше diff, чем команда способна честно проверить до пятницы.
Ответ: агенты проверяют агентов, а люди читают выборочно, а не всё подряд. Доверие зарабатывается статистически, а не по каждому diff.
Агенты-ревьюеры находят подсаженные регрессии наравне с медианным человеком-ревьюером в слепых тестах.
Описание работы меняется. Инженеры перестают быть машинистками со вкусом и становятся диспетчерами со вкусом: декомпозируют работу, раздают её флотам, разрешают конфликты между агентами, которые оба тронули один модуль.
Инструменты, которые смотрят на агентов как на флот, а не как на окно чата, становятся интерфейсом к кодовой базе по умолчанию.
Один инженер тянет 10 и более параллельных потоков работы, а разрешение конфликтов слияния между ветками агентов само по себе в основном автоматизировано.
Надёжность на длинной дистанции переходит порог. Работа, выданная в 18:00, достаточно часто готова к объединению в 9:00, чтобы не поставить ночную смену казалось простоем фабрики.
Настройка окружения, нестабильные тесты и возня с учётными данными — скучные режимы отказа, которые убивали автономные прогоны в 2025-м, — по большей части решены инженерно, а не моделью.
Автономные прогоны от 8 часов и дольше успешно закрывают большинство рутинных тикетов без вмешательства человека.
Первые команды, небольшие, выпускают код, написанный преимущественно агентами, не читая каждую строку, и их уровень дефектов держится. Ничего мистического: слои ревью, канареечные выкладки, быстрый откат и привычка писать спецификации вместо кода.
Все спорят, обобщается ли это. Сам спор — признак того, что уровень достигнут.
Хотя бы одна команда, которую мы можем назвать, включая нашу, проходит все шлюзы F4 в течение полного квартала и публикует цифры.
Мы не прогнозируем полную автономность в 2026 или 2027 году. Честные неизвестные: выдержит ли ревью агентами враждебную сложность, сможет ли спецификация заменить чтение кода как якорь доверия в масштабе и останется ли ночная смена по экономике вычислений дешевле людей, которых она усиливает. F5 — пункт рубрики, чтобы мы узнали его, когда увидим, а не обещание.
Наша оценка на август 2026 года по нашей команде и командам, за которыми мы внимательно следим. F3 в основном открыт. F4 в основном закрыт. Этот разрыв и есть работа.
2 открыто 3 частично 3 закрытоиз 8 шлюзов F3 и F4
Рутинные тикеты без вмешательства по ходу задачи
Норма для чётко очерченной работы в изолированных рабочих областях.
3+ параллельных потока работы на инженера
Ежедневная практика для нашей команды и самых активных пользователей.
Большинство объединённых агентских PR без правок
Верно для рутины, но пока не для сложных рефакторингов.
Половина объединённых изменений — агентский код без правок
Люди всё ещё правят или сильно направляют большинство объединённых diff.
Ревью агентами наравне с человеческим
Ревью агентами находит настоящие баги, но пока ему не доверяют в одиночку.
10+ параллельных потоков работы без потери состояния
В хорошие дни возможно. Стоимость надзора пока растёт слишком быстро.
Ночные прогоны без присмотра, готовые к слиянию к утру
Работает, когда окружения чистые. Чистые они редко.
От тикета до продакшена меньше суток, медиана
Очереди ревью и CI съедают выигрыш, который дают агенты.
Superset — верстак для перехода от F3 к F4: параллельные агенты в изолированных рабочих областях, флоты, которыми реально можно управлять, и поверхность для ревью кода, который вы не писали.