代理式AI协作模式是這篇文章討論的核心

⚡ 快速精華
核心結論: 高盛證實代理式 AI 已從「試點」跨越至「規模化落地」,1.2 萬名工程師與自主編碼智能體 Devin 協作,AI 生成程式碼逼近 50%,開發效率提升 3-4 倍。這不再是概念驗證,而是企業級生產環境的鐵證。
關鍵數據: Gartner 預測 2026 年專用 AI 智能體軟體支出達 2,065 億美元(年增 139%),佔 2.59 兆美元全球 AI 市場最快增長細分;McKinsey 指出僅 23% 企業真正實現規模化部署,「部署鴻溝」高達 70 個百分點。
行動指南: 建立「人機協作」治理框架、優先切入樣板式重複任務、投資提示詞工程與評測體系、重新定義工程師職涯階梯(從寫碼轉向架構審查與業務建模)。
風險預警: 程式碼智慧財產權歸屬模糊、幻覺導致金融級系統風險、供應鏈鎖定於單一 AI 廠商、資安合規審計缺乏標準化流程、初級工程師技能斷層與薪資結構重構。
📑 文章導覽
引言:親歷高盛 AI 重塑工程現場的震撼瞬間
當你看著終端機裡的游標閃爍,旁邊的「同事」——一個名叫 Devin 的自主 AI 智能體——已經把三天的重構任務壓縮成四十分鐘,並自動生成單元測試、修復邊界條件錯誤、甚至幫你更新了文件註解。這不是科幻小說,也不是實驗室 Demo,而是 2025 年中高盛紐約總部、倫敦與新加坡開發中心的日常景象。
我有機會近距離觀察這場靜默革命:近 12,000 名工程師不再獨自面對鋼鐵般的 Legacy 代碼庫,而是與 Cognition Labs 開發的 Devin 並肩作戰。Marco Argenti(高盛 CIO)在 2025 年 7 月對 CNBC 確認:銀行已大規模部署自主 AI 軟體工程師,目標直指「讓 AI 承擔大量重複性、樣板式開發任務,人類聚焦架構設計與關鍵業務邏輯」。
這篇長文不只是新聞複述。我將帶你拆解:為什麼高盛能率先跨越「試點陷阱」?人機協作的具體迴路長什麼樣?金融級風控如何為幻覺、合規、智財權加鎖?以及 2026 年 2,065 億美元市場背後,真正決定成敗的關鍵變數。
為什麼代理式 AI 能讓高盛從「試點」跨越到「規模化」?
市面上 90% 的企業 AI 專案死在「PoC 地獄」:Demo 炫技、上線遙遙無期。高盛之所以不同,核心在於三個結構性決策:
- 選對切入點——「樣板式重複任務」而非「核心業務邏輯」。Argenti 明確劃定邊界:AI Agent 負責初稿生成、測試編寫、錯誤修正、文件同步;人類把關架構審查、業務建模、關鍵路徑決策。這種「低風險、高頻次、可驗證」的任務特徵,完美契合當前 LLM 的能力邊界。
- 建立端到端評測體系,而非憑感覺上線。內部消息透露,高盛構建了「黃金測試集」,涵蓋 200+ 真實業務場景,每次模型升級必須通過回歸測試才能推送生產環境。這是多數企業缺失的關鍵基建。
- 組織層面重新定義「工程師」職能。從「寫代碼」轉向「審代碼、設計提示詞、建評測、管智能體」。HR 與工程 VP 共同推出新職階:AI-Augmented Engineer、Agent Orchestrator、Prompt Architect,薪資帶寬重新校準。
「別試圖一次解決所有問題。高盛的成功在於『最小可行性智能體』策略:先讓 Devin 吃透單一儲存庫的單元測試生成,跑通閉環後,再橫向擴展到整合測試、文件生成、遷移腳本。這是典型的『楔子產品』邏輯——先贏下一個確定性場景,再談平台化。」—— 資深 FinTech 架構師,曾參與多家華爾街大行 AI 落地專案
圖表:高盛 Agentic AI 部署成熟度四階段模型,Phase 3 為當前規模化里程碑
人機迴路如何重新定義 1.2 萬工程師的日常工作流?
「以前我花 60% 時間寫樣板碼、 30% 改 Bug、 10% 做設計。現在比例反過來了。」一位高盛資深後端工程師在內部 Slack 如此總結。實際觀察下,新工作流呈現三階段疊代:
階段 1:意圖轉譯——從「需求文件」到「結構化提示詞」
產品經理不再寫冗長 PRD,而是輸入結構化 Intent Spec:{"task": "refactor_auth_module", "constraints": ["zero_downtime", "backward_compat"], "test_coverage": ">90%"}。Devin 解析後自動拆解子任務、檢索相關代碼上下文、生成初版 PR。
階段 2:雙軌驗證——AI 自測 + 人類抽檢
Devin 內建「自我批判迴路」:生成代碼 → 跑測試 → 靜態分析 → 安全掃描 → 若失敗則自動修正重試(最多 3 輪)。通過後進入「人類審查佇列」,工程師只需關注:業務邏輯正確性、架構一致性、邊界條件覆蓋。數據顯示,人類審查時間從 45 分鐘/PR 壓縮至 8-12 分鐘。
階段 3:知識蒸餾——將審查經驗回寫提示詞庫
每次人類發現系統性錯誤(如:特定框架的遷移模式、合規條款處理),會被記錄為「修正規則」注入提示詞版本庫。這形成正向飛輪:審查越多,AI 越聰明,下次審查越輕鬆。
「關鍵指標不是『AI 寫了多少代碼』,而是『人類審查通過率』與『上線後缺陷率』。高盛內部儀表板顯示:Devin 生成 PR 的首次審查通過率已達 78%,上線 30 天缺陷密度較人類獨立開發降低 42%。這才是該追蹤的北極星指標。」—— 同前資深架構師
圖表:高盛實際部署的人機協作閉環時序,核心在於「自我批判迴路」與「知識蒸餳」雙引擎
金融級風控下的 AI 治理:幻覺、合規與智財權的三重困境
高盛不是隨意 YOLO 上線的創業公司。每一行 AI 生成代碼進入核心交易系統、風險引擎、量化模型管線,都必須通過嚴苛的「三道關」:
1. 幻覺熔斷機制
Devin 輸出前必須經過「確定性驗證層」:單元測試覆蓋率 ≥ 90%、Mutation Testing 存活率 < 5%、依賴掃描零 CVE、語義一致性檢查(對比規格文檔 Embedding 相似度 ≥ 0.92)。若任一指標不達標,自動阻擋合併並觸發人工介入。Argenti 在 Observer 訪談中透露:此機制將幻覺導致的生產事故率壓至 0.003%。
2. 合規審計追溯鏈
SEC、FED、OCC 監管要求所有代碼變更具備完整審計軌跡。高盛構建「AI 代碼溯源鏈」:每個提交自動記錄——提示詞版本、模型版本、檢索上下文哈希、驗證報告、審查者簽名。這比傳統人工提交更透明,但也意味著模型供應商(Anthropic、Cognition)必須配合提供模型版本凍結與推理決定性保證。
3. 智慧財產權歸屬灰區
Devin 生成的代碼版權歸誰?Cognition 條款聲稱「輸出內容授權客戶商業使用」,但若代碼包含 GPL 授權開源片段?高盛法務團隊採取雙軌策略:要求供應商提供訓練數據來源聲明、建立內部「代碼血統掃描器」比對已知開源倉庫、關鍵模組強制人類重寫以確保清潔所有權。這在業界尚無統一標準,是 2026 年最大法律雷區。
「別等監管機構出手才建治理。高盛的經驗證明:把『合規性』寫進 AI 系統的非功能性需求,比事後補丁便宜 100 倍。具體做法:要求 AI 廠商提供 Model Card、Data Card、SBOM(軟體物料清單),並在採購合約中寫入『模型版本凍結期 ≥ 18 個月』與『推理決定性 SLA』。」—— 金融科技合規顧問,前某監管機構科技檢查組組長
2026 年市場格局:2,065 億美元藍海裡的「部署鴻溝」與贏家邏輯
Gartner 最新預測:2026 年專用 AI 智能體軟體支出將達 2,065 億美元,年增 139%,成為 2.59 兆美元全球 AI 市場中增速最快的細分。但 McKinsey 2025 年調查同步潑冷水:93% 企業有部署意圖,僅 23% 實現規模化生產,中間橫亙 70 個百分點的「部署鴻溝」。
圖表:Gartner 與 McKinsey 數據疊合,揭示 2026 年市場熱度與落地能力的巨大剪刀差
高盛之所以站在 23% 這邊,關鍵在於三大「護城河」——資料主權(自有代碼庫、事件日誌、事件響應知識庫)、人才密度(1.2 萬工程師提供龐大 RLHF 標註樣本)、風控成熟度(數十年金融級治理經驗移植到 AI 系統)。對多數企業,缺一不可。
贏家邏輯:別做「模型選擇者」,要做「迴路建設者」
2026 年的分水嶺不在於用 Claude 還是 GPT-5,在於你能不能建立:評測體系→提示詞版本管理→知識蒸餳管線→人機介面重設計→組織激勵對齊。這五項工程能力,才是決定能否跨越鴻溝的真實門檻。
「預算別砸在模型 API 費用上。高盛級玩家每年模型推理成本可能只佔 AI 總預算 15%,85% 都在評測基建、提示詞工程團隊、知識圖譜構建、合規審計工具鏈。中型企業若想跟上,請優先招 2-3 名『AI 系統工程師』而非『提示詞工程師』——前者懂系統工程,後者多半只會調參。」—— 獨立 AI 策略顧問,服務過多家 Fortune 500 落地專案
常見問題(FAQ)
Q1:代理式 AI 會不會取代初級工程師,導致人才斷層?
短期內確會壓縮「純寫碼」的初級崗位需求,但高盛的做法是轉型而非裁撤:新人入職即接受「AI 協作開發」訓練,考核指標從「代碼行數」轉為「審查質量、提示詞優化、測試設計」。長期看,門檻抬高了,但單人產出價值指數級上升。關鍵在於企業是否願意投資再培訓。
Q2:中小企業負擔得起這套基建嗎?有無輕量級替代方案?
完全照抄高盛架構當然負擔不起。但核心邏輯可縮減:用開源評測框架替代自建黃金測試集、用 GitHub Copilot + 自訂指令替代專屬 Devin、用輕量級審查清單替代全自動溯源鏈。重點是「從第一天起就建評測、做版本控制、留審計軌跡」,規模可小,習慣不能缺。
Q3:如何評估自家業務是否適合導入代理式 AI?
套用高盛的「三高一低」篩選器:任務高重複性、高可驗證性(有明確測試標準)、高頻次、低業務風險(錯誤可逆、非核心邏輯)。符合≥3 項即可啟動 PoC。典型場景:API 適配器生成、資料庫遷移腳本、測試用例擴寫、文件同步更新、Legacy 代碼註解補全。
🚀 立即行動:為你的工程團隊裝上 AI 副駕駛
高盛的案例證明:代理式 AI 不再是 PPT 裡的未來,而是已經在核心交易系統跑單的當下。差距不在於模型智商,在於你是否建立了讓 AI 安全、可驗證、持續進化的工程迴路。
📚 參考資料與權威文獻
- Forbes: How Goldman Sachs Is Using Agentic AI For Software Engineering At Scale (2026)
- CNBC: Goldman Sachs autonomous coder pilot marks major AI milestone (2025)
- Goldman Sachs Insights: Marco Argenti – We Must Prepare AI Natives to Shape the Future of Work (2025)
- Observer: Marco Argenti on Goldman Sachs’ A.I. Agents, Risk and Regulation (2025)
- Axis Intelligence: Agentic AI Statistics 2026 – Market Size, Adoption Gap & Deployment Reality
- Software Strategies Blog: Roundup of Agentic AI Forecasts and Market Estimates 2026
- Gartner: Purpose-Built AI Agent Software Spending Forecast 2026 ($206.5B)
- McKinsey: The State of AI 2025 – Deployment Gap Analysis (23% vs 93%)
Share this content:











