手動
軟體史的大部分時間每一行都由人寫。工具負責編譯、檢查、報錯。鍵盤就是工廠。
- 沒有。這是起點。
工廠自主的六個等級、等級之間的關卡,以及我們對2026年能走多遠的預測。現在寫下來,方便你以後給我們打分。
關於AI的預測很廉價,因為沒人回頭核對。這個頁面是一份評分表,不是一種感覺:下面每一道關卡,對一支真正在交付真實軟體的團隊來說,非真即假。關卡開啟時我們會更新,但不會挪動球門。
F3 · 委派
2.5/3 F3 · 1/5 F4
2027 · 預測
借用自動駕駛汽車的分級方式,用來衡量軟體的構建方式。有意思的躍遷是F3到F4:從你委派的代理程式,變成你指揮的工廠。
F3 · you are here
每一行都由人寫。工具負責編譯、檢查、報錯。鍵盤就是工廠。
自動補全變好了。模型會建議接下來的幾個token,但沒有哪次交付不是人敲出大部分程式碼的。
代理程式寫出完整的函式和檔案,人類盯著每一步、批准每一條命令。一個代理程式,一個人。更快,但仍是序列。
代理程式從工單一路負責到差異。人類審查結果,而不是擊鍵過程。注意力從寫程式碼轉向定義工作和判斷成果。一名工程師在隔離工作區裡同時跑好幾個代理程式。
成群的代理程式規劃、實現、審查並測試彼此的工作。人類定方向、裁決例外、把握品味。人類注意力的單位不再是拉取請求,而是決策。
輸入結果,輸出軟體。人類只指定意圖、約束和預算。工廠自行排產、持續交付、監控上線內容,並自行回滾。大多數變更在無人參與的情況下合併,故障率不升。
一半是記錄,一半是下注。前兩條已經在發生。其餘的寫得足夠具體,足以被證明是錯的。
工程師的時間不再花在寫程式碼上,而是花在讀程式碼上。2025年就用上並行代理程式的團隊最先撞牆:十個代理程式在午飯前產出的差異,一個團隊到週五也認真審不完。
應對辦法是:讓代理程式審查代理程式,人類改為抽樣而不是通讀。信任靠統計建立,而不是逐個差異建立。
在盲測中,代理程式審查者發現植入迴歸的能力與中位水平的人類審查者持平。
崗位描述變了。工程師不再是有品味的打字員,而成了有品味的排程員:拆解工作、分派給代理程式叢集、在兩個改了同一個模組的代理程式之間做裁決。
把代理程式當作叢集而不是聊天視窗的工具,成為存取程式碼庫的預設介面。
一名工程師能同時維持10條以上並行工作流,且代理程式分支之間的合併衝突解決本身也基本自動化。
長週期可靠性越過了一個門檻。傍晚6點派出去的活兒,早上9點常常已經可以合併,以至於不排夜班就像讓工廠空轉。
環境搭建、不穩定的測試、憑證串聯,這些在2025年讓無人值守執行折戟的無聊失敗模式,大多是被工程手段消除的,而不是被模型消除的。
無人值守執行8小時以上,在多數常規工單上無需人工解阻即可完成。
第一批團隊,規模都不大,在不逐行閱讀的情況下交付了以代理程式為主的程式碼,缺陷率並沒有惡化。背後沒什麼玄學:分層審查、灰度釋出、快速回滾,以及寫規格而不是寫程式碼的習慣。
所有人都在爭論這能否推廣。這場爭論本身就說明這一級別已經達到了。
至少有一支叫得出名字的團隊(包括我們自己)連續一個季度通過全部F4關卡,並公佈資料。
我們不預測2026或2027年實現完全自動駕駛。誠實地講,未知數有三個:代理程式審查能否扛住對抗性的複雜度;規格說明能否在大規模場景下取代讀程式碼,成為信任的錨點;以及算力成本能否讓夜班始終比它所增強的人力更便宜。F5寫進評分表,是為了在它出現時能認出來,而不是一個承諾。
這是我們截至2026年8月的判斷,依據是我們自己的團隊和我們密切關注的團隊。F3大多已開啟,F4大多還沒開啟。這道差距就是要做的事。
常規工單無需中途干預
在隔離工作區裡做範圍清晰的工作時,這已是常態。
每位工程師3條以上並行工作流
這是我們團隊和重度使用者的日常。
多數已合併的代理程式PR零修改
常規工作成立,棘手的重構還不行。
一半的合併變更是零修改的代理程式程式碼
多數合併的差異仍需人類修改或大量引導。
代理程式審查與人類審查持平
代理程式審查能抓到真實的bug,但還不能單獨信任。
10條以上並行工作流且不丟狀態
狀態好的時候能做到。監督成本成長仍然太快。
無人值守通宵執行,早上可合併
環境乾淨時可行。而環境很少乾淨。
從工單到上線中位不足一天
審查和CI排隊把代理程式帶來的收益吃掉了。