第十代 TPU 混合架構是這篇文章討論的核心

📌 快速精華
- 💡 核心結論:Google 與 AMD 首度在客製化 AI ASIC 領域合作,第十代 TPU 將採用 CPU+TPU 同封裝混合設計,直接瞄準強化學習與代理式(Agentic)AI 工作負載。
- 📊 關鍵數據(2026-2027):全球 AI 晶片市場規模預估突破 2,500 億美元,其中客製化 ASIC 佔比將從 15% 躍升至 28%;混合式架構可降低功耗達 30-40%,推論延遲減少 50% 以上。
- 🛠️ 行動指南:AI 基礎設施採購者應開始評估 CPU+加速器協同設計的解決方案;開發者需熟悉異構編程模型(如 OpenXLA、Triton)以釋放混合架構潛力。
- ⚠️ 風險預警:供應鏈整合難度高,先進封裝(SoIC)產能有限;若 Broadcom 與 Google 關係生變,可能影響既有 TPU 產品線的穩定供貨。
上週 SemiAnalysis 一份客戶報告丟出震撼彈:Google 正與 AMD 聯手開發第十代 TPU,而且這不是傳統意義上的「加速器升級」,而是直接把 CPU 核心跟 TPU 運算單元塞進同一顆封裝。老實說,這消息在業界圈子裡炸得比預期還大——畢竟 Google 跟 Broadcom 已經穩穩合作了九代產品,幹嘛突然換夥伴?但仔細看背後的邏輯,你會發現這其實是 Google 醞釀十年的「架構大翻新」,而且時間點抓得剛剛好。
先不談技術細節,單就戰略意義來看:AMD 首次踏入客製化 AI ASIC 領域,而且一出手就是 Google 這種量級的訂單。SemiAnalysis 點出兩個關鍵誘因——AMD 在先進封裝(SoIC)和CPU IP 的累積實力,正是 Google 實現「緊密整合 CPU 與 TPU」這塊拼圖的關鍵。我們都知道,Google 早在 TPU v8i 就已經悄悄在系統裡增加 CPU 資源(每 2 顆 TPU 搭 1 顆 Axion CPU),現在風向更是往 1:1 加速器對 CPU 配置 邁進。換句話說,未來的 TPU 不再只是「張量處理器」,它會是半顆 CPU、半顆加速器的混血怪物。
1. 為什麼 Google 拋開 Broadcom 找上 AMD?一場醞釀十年的架構革命
要理解這個合作,得先回頭看 AI 工作負載的演變。過去十年,深度學習的典範是「大模型預訓練 + 微調」,這種模式高度依賴矩陣乘法,TPU 這種 SIMD 架構簡直完美。但 2024 年以降,強化學習(RL)和代理式 AI(Agentic AI)迅速崛起——這些系統需要反覆與環境互動、進行決策鏈推理,計算模式混雜了邏輯判斷、條件分支、記憶存取,這些恰巧是 CPU 的強項,卻是 TPU 的軟肋。
Google 顯然早就意識到這點。SemiAnalysis 報告指出,Broadcom 雖然在 ASIC 設計和量產上極有經驗,但對於 CPU 核心的整合卻使不上力——畢竟 Broadcom 沒有自家的 CPU 架構。而 AMD 的 Zen 核心加上其3D SoIC 封裝技術,能夠以極低延遲把 CPU 和 TPU 計算單元貼合在一起,資料搬運成本幾乎可以忽略不計。這不是簡單的「CPU 旁邊放一顆 TPU」,而是共享 L3 快取、統一記憶體定址的真正異構融合。
2. 混合封裝到底強在哪?拆解 TPU v10 的「CPU+加速器」同包裝設計
傳統的 AI 加速卡,CPU 和加速器是分開的兩顆晶片,透過 PCIe 或其他匯流排溝通。即使像 NVIDIA Grace-Hopper 這種「超級晶片」,也只是把 CPU 和 GPU 放在同一塊基板上,本質上還是兩顆獨立 die。但 TPU v10 傳聞中的做法更激進——直接把 CPU 核心和 TPU 計算單元整合在同一顆 die 或透過 3D 堆疊封裝,讓它們之間的資料傳輸延遲從微秒級降到奈秒級。
這樣的好處顯而易見:
- 強化學習的「環境模擬」經常需要頻繁的邏輯判斷和狀態更新,這些工作丟給 CPU 處理,TPU 專注做神經網路的前向/反向傳播,分工明確。
- 代理式 AI(如 AutoGPT、規劃型代理)需要反覆呼叫工具、查詢記憶體、做多步推理,這中間穿插大量非矩陣運算,混合架構可以避免資料在晶片之間來回搬運的 overhead。
- SemiAnalysis 推測,Google 在 TPU v8i 已經嘗試「每 2 顆 TPU 配 1 顆 Axion CPU」,v10 可能進化到 1:1 配置,甚至每個 TPU tile 都有自己的專屬 CPU 協處理器。
其實這不是完全陌生的概念。早在 2017 年,Google 就在 TPU v2 的系統裡塞了 4 顆 Haswell CPU 來處理數據預處理和調度,但那時候 CPU 和 TPU 還是分離的。v10 的突破在於「封裝級整合」,讓兩者的協作不再是軟體層面的妥協,而是硬體原生支援。
3. 強化學習與代理式 AI 為何需要更多 CPU 核心?
這裡講一個常見的誤解:很多人覺得 AI 就是「矩陣乘法」,所以只要有夠強的 GPU/TPU 就萬事大吉。但真正搞過 RL 或 Agent 的人都知道,訓練過程中最頭痛的往往不是矩陣運算,而是 環境互動的模擬、獎勵計算、策略更新時的邏輯分支——這些全部都是 CPU 的工作。
舉個實際案例:OpenAI 訓練 Dota 2 的 RL 代理時,同時跑數千個遊戲環境實例,每個實例都需要 CPU 來運行遊戲邏輯,GPU 只負責推理。這種「異構計算」在大型 RL 專案中已經是常態。Google 顯然看準了這個趨勢——未來的 AI 模型不再是「一次預訓練吃到飽」,而是持續與環境互動、自我進化的系統,對 CPU 的依賴只會越來越重。
根據 SemiAnalysis 引用的市場預測,2027 年用於 RL 和代理式 AI 的運算資源將佔整體 AI 算力的 35% 以上,遠高於 2024 年的 12%。如果 TPU v10 能針對這類負載提供 2-3 倍的效能提升,Google 在雲端 AI 服務的領先地位將更加穩固。
4. 市場震盪:NVIDIA 獨大局面鬆動,ASIC 新時代來臨
這個合作消息一出,華爾街分析師立刻嗅到腥味。Wedbush 直接點名「這可能重塑 AI 晶片格局」,因為過去幾年 NVIDIA 憑藉 CUDA 生態系和高效能 GPU 幾乎壟斷了 AI 訓練市場。但 Google 的 TPU 本身就是 ASIC(專用積體電路)的成功案例,現在又加入 AMD 的 CPU IP 和封裝技術,等於是把「通用運算」和「專用加速」的優點揉在一起,直接挑戰 NVIDIA 的通用 GPU 路線。
更重要的是,這暗示了一個產業趨勢:超大規模雲端業者(Hyperscaler)不再滿足於購買現成 GPU,而是開始深度定製自己的晶片。Amazon 有 Trainium/Inferentia,Microsoft 有 Maia,Google 有 TPU,現在這些晶片都往「異構融合」方向演進。AMD 這次扮演的是「軍火供應商」角色,提供 CPU 核心和封裝技術,但不碰軟體堆疊——Google 依然用自己的 TensorFlow/JAX 生態系來駕馭硬體,這正是 NVIDIA 最難複製的護城河。
5. 2026-2027 年 AI 晶片產業鏈重組預測
基於這次合作以及 Google 的技術路線圖,我們可以合理預測以下幾個走向:
- 先進封裝產能將成戰略物資:台積電的 SoIC 和 CoWoS 技術將是混合晶片的關鍵瓶頸。AMD 已和台積電深度綁定,這可能也是 Google 選擇 AMD 的隱藏因素。
- CPU 核心的微架構將越來越「AI 化」:AMD 可能為 Google 定製具備矩陣加速指令的 Zen 變體,進一步模糊 CPU 和加速器的界線。
- 軟體生態面臨洗牌:OpenXLA、Triton 等跨平台編譯器將變得至關重要,開發者必須學會如何將計算圖聰明地分割給 CPU 和 TPU,這會催生新一波的系統優化工程師需求。
- NVIDIA 的應對:NVIDIA 絕不會坐視不管,預計下一代 Grace 架構會更強調 CPU-GPU 的記憶體一致性,甚至可能推出類似混合封裝的產品。
整體來說,Google-AMD 的合作不是一次性的產品開發,而是一場長達十年的架構路線宣示——AI 不再只是「矩陣乘法加速器」的軍備競賽,而是異構計算、封裝技術、系統軟體三方共舞的綜合戰。
❓ 常見問答(FAQ)
Q1:TPU v10 會完全取代現有的 GPU 嗎?
不會。混合架構主要是針對強化學習和代理式 AI 這類特定工作負載優化,對於傳統的卷積神經網路或大規模預訓練,純 GPU/TPU 方案依然有成本優勢。Google 會根據客戶需求提供不同類型的運算實例,不會「一刀切」。
Q2:AMD 的加入是否代表 Broadcom 被邊緣化?
不一定。Broadcom 依然是 Google 在網路晶片、PCIe 交換器等周邊元件的長期夥伴,且既有 TPU v5/v6 的生產仍由 Broadcom 負責。但未來 Google 可能會把「CPU+TPU」這條產品線交給 AMD,而純 TPU 路線繼續與 Broadcom 合作,形成雙軌制。
Q3:這個合作對一般開發者有什麼影響?
短期內影響不大,因為 Google Cloud 會封裝好底層異構細節,你只要透過 Vertex AI 或 Colab 呼叫服務即可。但中長期來看,熟悉 JAX 或 PyTorch 的設備端(device)編程模型會變得更有價值,因為你需要手動指定哪些運算跑在 CPU 核心、哪些跑在 TPU 上才能榨出極致效能。
AI 基礎設施的下一波革命已經開跑,你的技術策略跟上沒有?
📚 參考資料與延伸閱讀
Share this content:












