预测 · 发布于2026年8月

自动驾驶的软件工厂

工厂自主的六个等级、等级之间的关卡,以及我们对2026年能走多远的预测。现在写下来,方便你以后给我们打分。

关于AI的预测很廉价,因为没人回头核对。这个页面是一份评分表,不是一种感觉:下面每一道关卡,对一支真正在交付真实软件的团队来说,非真即假。关卡开启时我们会更新,但不会挪动球门。

评分表

工厂自主的六个等级

借用自动驾驶汽车的分级方式,用来衡量软件的构建方式。有意思的跃迁是F3到F4:从你委派的智能体,变成你指挥的工厂。

Fig. 1 · Human share of the effort behind a merged changeSchematic, by autonomy level. Hover for values.
0%50%100%100%F0F1F235%F3F42%F5

F3 · you are here

F0

手动

软件史的大部分时间

每一行都由人写。工具负责编译、检查、报错。键盘就是工厂。

关卡
  • 没有。这是起点。
F1

辅助

2021至2023

自动补全变好了。模型会建议接下来的几个token,但没有哪次交付不是人敲出大部分代码的。

关卡
  • 多数新文件中出现了模型建议的代码。
  • 没有人因此改变审查方式。
F2

监督

2024

智能体写出完整的函数和文件,人类盯着每一步、批准每一条命令。一个智能体,一个人。更快,但仍是串行。

关卡
  • 智能体能端到端完成跨文件改动。
  • 合并前人类会逐行阅读。
  • 一个人同时最多驱动一个智能体。
F3

委派

2025至今认真的团队都在这里

智能体从工单一路负责到差异。人类审查结果,而不是击键过程。注意力从写代码转向定义工作和判断成果。一名工程师在隔离工作区里同时跑好几个智能体。

F4

编排

2026年的赌注工厂

成群的智能体规划、实现、审查并测试彼此的工作。人类定方向、裁决例外、把握品味。人类注意力的单位不再是拉取请求,而是决策。

F5

自主

不是2026年的主张完全自动驾驶

输入结果,输出软件。人类只指定意图、约束和预算。工厂自行排产、持续交付、监控上线内容,并自行回滚。大多数变更在无人参与的情况下合并,故障率不升。

关卡
  • 多数生产变更在无人阅读差异的情况下合并。
  • 变更失败率连续两个季度不高于人类时代的基线。
  • 工厂回滚自己的坏部署,比人类值班更快。
  • 留在环路里的人负责判断,而不是产能。
预测

2026年会怎么走

一半是记录,一半是下注。前两条已经在发生。其余的写得足够具体,足以被证明是错的。

Fig. 2 · Merged changes written by agents, zero human editsIndustry median, our estimate. Dashed is forecast. The first F4 teams cross the gate earlier.
0%25%50%20242025202620272028F4 gate · 50%TODAY
2026年初

审查成为瓶颈

已发生

工程师的时间不再花在写代码上,而是花在读代码上。2025年就用上并行智能体的团队最先撞墙:十个智能体在午饭前产出的差异,一个团队到周五也认真审不完。

应对办法是:让智能体审查智能体,人类改为抽样而不是通读。信任靠统计建立,而不是逐个差异建立。

需要成真的条件

在盲测中,智能体审查者发现植入回归的能力与中位水平的人类审查者持平。

2026年中

调度员出现

进行中

岗位描述变了。工程师不再是有品味的打字员,而成了有品味的调度员:拆解工作、分派给智能体集群、在两个改了同一个模块的智能体之间做裁决。

把智能体当作集群而不是聊天窗口的工具,成为访问代码库的默认界面。

需要成真的条件

一名工程师能同时维持10条以上并行工作流,且智能体分支之间的合并冲突解决本身也基本自动化。

2026年末

夜班

预测

长周期可靠性越过了一个门槛。傍晚6点派出去的活儿,早上9点常常已经可以合并,以至于不排夜班就像让工厂空转。

环境搭建、不稳定的测试、凭据串联,这些在2025年让无人值守运行折戟的无聊失败模式,大多是被工程手段消除的,而不是被模型消除的。

需要成真的条件

无人值守运行8小时以上,在多数常规工单上无需人工解阻即可完成。

2027

第一批F4团队

预测

第一批团队,规模都不大,在不逐行阅读的情况下交付了以智能体为主的代码,缺陷率并没有恶化。背后没什么玄学:分层审查、灰度发布、快速回滚,以及写规格而不是写代码的习惯。

所有人都在争论这能否推广。这场争论本身就说明这一级别已经达到了。

需要成真的条件

至少有一支叫得出名字的团队(包括我们自己)连续一个季度通过全部F4关卡,并公布数据。

再往后:F5不是近期的主张

我们不预测2026或2027年实现完全自动驾驶。诚实地讲,未知数有三个:智能体审查能否扛住对抗性的复杂度;规格说明能否在大规模场景下取代读代码,成为信任的锚点;以及算力成本能否让夜班始终比它所增强的人力更便宜。F5写进评分表,是为了在它出现时能认出来,而不是一个承诺。

评分表

行业实际走到了哪里

这是我们截至2026年8月的判断,依据是我们自己的团队和我们密切关注的团队。F3大多已开启,F4大多还没开启。这道差距就是要做的事。

F3

常规工单无需中途干预

在隔离工作区里做范围清晰的工作时,这已是常态。

已开启
F3

每位工程师3条以上并行工作流

这是我们团队和重度用户的日常。

已开启
F3

多数已合并的智能体PR零修改

常规工作成立,棘手的重构还不行。

部分开启
F4

一半的合并变更是零修改的智能体代码

多数合并的差异仍需人类修改或大量引导。

未开启
F4

智能体审查与人类审查持平

智能体审查能抓到真实的bug,但还不能单独信任。

未开启
F4

10条以上并行工作流且不丢状态

状态好的时候能做到。监督成本增长仍然太快。

部分开启
F4

无人值守通宵运行,早上可合并

环境干净时可行。而环境很少干净。

部分开启
F4

从工单到上线中位不足一天

审查和CI排队把智能体带来的收益吃掉了。

未开启

工厂需要一个车间

Superset是F3到F4这段过渡期的工作台:隔离工作区里的并行智能体、真正管得过来的智能体集群,以及一套用来审查非你所写代码的界面。