手动
软件史的大部分时间每一行都由人写。工具负责编译、检查、报错。键盘就是工厂。
- 没有。这是起点。
工厂自主的六个等级、等级之间的关卡,以及我们对2026年能走多远的预测。现在写下来,方便你以后给我们打分。
关于AI的预测很廉价,因为没人回头核对。这个页面是一份评分表,不是一种感觉:下面每一道关卡,对一支真正在交付真实软件的团队来说,非真即假。关卡开启时我们会更新,但不会挪动球门。
F3 · 委派
2.5/3 F3 · 1/5 F4
2027 · 预测
借用自动驾驶汽车的分级方式,用来衡量软件的构建方式。有意思的跃迁是F3到F4:从你委派的智能体,变成你指挥的工厂。
F3 · you are here
每一行都由人写。工具负责编译、检查、报错。键盘就是工厂。
自动补全变好了。模型会建议接下来的几个token,但没有哪次交付不是人敲出大部分代码的。
智能体写出完整的函数和文件,人类盯着每一步、批准每一条命令。一个智能体,一个人。更快,但仍是串行。
智能体从工单一路负责到差异。人类审查结果,而不是击键过程。注意力从写代码转向定义工作和判断成果。一名工程师在隔离工作区里同时跑好几个智能体。
成群的智能体规划、实现、审查并测试彼此的工作。人类定方向、裁决例外、把握品味。人类注意力的单位不再是拉取请求,而是决策。
输入结果,输出软件。人类只指定意图、约束和预算。工厂自行排产、持续交付、监控上线内容,并自行回滚。大多数变更在无人参与的情况下合并,故障率不升。
一半是记录,一半是下注。前两条已经在发生。其余的写得足够具体,足以被证明是错的。
工程师的时间不再花在写代码上,而是花在读代码上。2025年就用上并行智能体的团队最先撞墙:十个智能体在午饭前产出的差异,一个团队到周五也认真审不完。
应对办法是:让智能体审查智能体,人类改为抽样而不是通读。信任靠统计建立,而不是逐个差异建立。
在盲测中,智能体审查者发现植入回归的能力与中位水平的人类审查者持平。
岗位描述变了。工程师不再是有品味的打字员,而成了有品味的调度员:拆解工作、分派给智能体集群、在两个改了同一个模块的智能体之间做裁决。
把智能体当作集群而不是聊天窗口的工具,成为访问代码库的默认界面。
一名工程师能同时维持10条以上并行工作流,且智能体分支之间的合并冲突解决本身也基本自动化。
长周期可靠性越过了一个门槛。傍晚6点派出去的活儿,早上9点常常已经可以合并,以至于不排夜班就像让工厂空转。
环境搭建、不稳定的测试、凭据串联,这些在2025年让无人值守运行折戟的无聊失败模式,大多是被工程手段消除的,而不是被模型消除的。
无人值守运行8小时以上,在多数常规工单上无需人工解阻即可完成。
第一批团队,规模都不大,在不逐行阅读的情况下交付了以智能体为主的代码,缺陷率并没有恶化。背后没什么玄学:分层审查、灰度发布、快速回滚,以及写规格而不是写代码的习惯。
所有人都在争论这能否推广。这场争论本身就说明这一级别已经达到了。
至少有一支叫得出名字的团队(包括我们自己)连续一个季度通过全部F4关卡,并公布数据。
我们不预测2026或2027年实现完全自动驾驶。诚实地讲,未知数有三个:智能体审查能否扛住对抗性的复杂度;规格说明能否在大规模场景下取代读代码,成为信任的锚点;以及算力成本能否让夜班始终比它所增强的人力更便宜。F5写进评分表,是为了在它出现时能认出来,而不是一个承诺。
这是我们截至2026年8月的判断,依据是我们自己的团队和我们密切关注的团队。F3大多已开启,F4大多还没开启。这道差距就是要做的事。
常规工单无需中途干预
在隔离工作区里做范围清晰的工作时,这已是常态。
每位工程师3条以上并行工作流
这是我们团队和重度用户的日常。
多数已合并的智能体PR零修改
常规工作成立,棘手的重构还不行。
一半的合并变更是零修改的智能体代码
多数合并的差异仍需人类修改或大量引导。
智能体审查与人类审查持平
智能体审查能抓到真实的bug,但还不能单独信任。
10条以上并行工作流且不丢状态
状态好的时候能做到。监督成本增长仍然太快。
无人值守通宵运行,早上可合并
环境干净时可行。而环境很少干净。
从工单到上线中位不足一天
审查和CI排队把智能体带来的收益吃掉了。