Marvell 記憶體三連發是這篇文章討論的核心




Marvell 在 FMS 2026 端出記憶體三連發:Bravera SC6 × CXL × 光學共享,Agentic AI 推理的 KV Cache 荒有解了?
FMS 2026 現場觀察:當 Agentic AI 推理規模擴大,記憶體容量、頻寬與連通性,已經跟算力一樣關鍵。(圖片來源:Pexels / panumas nikhomkhai)

八月初的聖塔克拉拉,氣溫逼近攝氏三十度,但真正讓與會者冒汗的,不是加州的太陽,而是 FMS 2026 會場裡一張張寫滿「記憶體不夠用」的簡報。八月四日到六日,Flash Memory Summit 在 Santa Clara Convention Center 與 Hyatt Regency 登場,Marvell 直接攤開家底:Bravera SC6、Structera CXL、Photonic Fabric 三大產品線,全部對準同一個靶心——Agentic AI 推理(Agentic AI Inference)。我穿梭在攤位與 keynote 之間,最深的第一手觀察是:大家終於承認,AI 時代的瓶頸早已不是「算得夠不夠快」,而是「記不記得住、搬不搬得動」。

快速精華:三分鐘看懂這齣記憶體大戲

💡 核心結論:Agentic AI 推理的瓶頸已從算力轉向記憶體。Marvell 用 Bravera SC6、Structera X CXL 與 Photonic Fabric 三箭齊發,把 KV Cache 從昂貴的 HBM 分層卸載到 SSD 與光學共享記憶體,讓「每 token 成本」大幅下降。

📊 關鍵數據(2027 預測量級):TrendForce 上修 2027 全球記憶體市場至 1.28 兆美元(年增約 44%);Gartner 預測 2026 全球 AI 支出達 2.59 兆美元,其中 Agentic AI 支出年增 141%;Photonic Fabric 宣稱可讓 token 吞吐量提升 2–3 倍

🛠️ 行動指南:把「熱資料放 HBM、溫資料放 CXL/SSD、冷資料放光學共享」的分層架構,納入 2026 下半年到 2027 年的 AI 基礎設施採購規劃,並以 TCO per token 當核心 KPI。

⚠️ 風險預警:記憶體供需缺口短期難補、漲價壓力仍在上行;Gartner 也警告超過 40% 的 Agentic AI 專案預期會失敗,別為了追熱潮而盲目擴充硬體。

Agentic AI 推理為什麼比訓練更燒記憶體?KV Cache 才是隱形黑洞

訓練是離線的、可分批的、錯了能重來;推理卻是即時的、串行的,每一個 token 都得在幾百毫秒內回應。而 Agentic AI 更狠——它會自主規劃、反覆呼叫工具、把上下文一層層疊上去,每一輪思考都在膨脹所謂的 KV Cache(Key-Value Cache)。這是 Transformer 架構生成時暫存注意力機制的暫存區,容量大致與 context length 成正比成長。

當 context window 從幾千 token 一口氣拉到十萬、百萬,KV Cache 常常佔據推理時 GPU 記憶體的一半以上。傳統 server-attached 架構把記憶體綁死在單一伺服器裡,模型一大、上下文一長,HBM 立刻爆倉。Marvell 在新聞稿裡點破:當 Agentic AI 推理規模擴大,記憶體容量、頻寬與連通性,已經與算力一樣關鍵。這不是行銷話術,而是硬體預算結構的實話——Gartner 預測 2026 年全球 Agentic AI 支出達 2,019 億美元、年增 141%,每一塊錢最後都要落到記憶體與儲存上。

Pro Tip|專家見解:如果你的推理服務延遲突然惡化,先別急著加 GPU——先量 KV Cache 佔比。很多時候瓶頸卡在記憶體階層,而不是 FLOPs 不夠。監控工具若能看到「KV Cache 命中率」與「HBM 置換率」,往往比盯 GPU 使用率更能找出真兇。

Marvell Bravera SC6 如何用 PCIe 6.0 把 KV Cache 從 HBM 趕到 SSD?

Bravera SC6 是 Marvell 在 FMS 2026 端出的 PCIe 6.0 SSD 控制器,效能直接是前一代 SC5 的兩倍,並預計在 2026 年第四季開始送樣。它的戰略意義很單純:讓更多 KV Cache 可以從一顆難求又貴的 HBM 卸載到 SSD,用「溫資料」的方式分層存放。HBM 拿來裝全量 KV Cache 根本是奢侈,SC6 把讀寫都變快的 SSD 變成 KV Cache 的緩衝區,整體基礎設施效率立刻改觀。

關鍵在於:卸載不等於丟棄。SC6 的雙倍效能,讓 SSD 的隨機讀寫足以承接推理過程中頻繁的 KV Cache 查詢,延遲增加有限,但每 token 的記憶體成本大幅下降。對大規模部署來說,這就是在精算「每百萬 token 的成本」——誰能把這數字壓低,誰就能在 Agentic AI 價格戰裡活下來。

Pro Tip|專家見解:採購 AI 儲存時別只看循序讀寫的跑分。KV Cache 卸載考驗的是 4K 隨機讀寫與 QoS 穩定性,SC6 這類 PCIe 6.0 控制器才是對症下藥的規格——務必要求廠商提供「KV Cache 卸載場景」下的壓力測試數據,而不是紙面峰值。

Structera CXL 與 Photonic Fabric:機櫃級到機群級的記憶體池化革命

如果說 Bravera SC6 是「把記憶體搬到 SSD」,那 Structera 與 Photonic Fabric 就是「讓記憶體長出翅膀」。Structera X 走 CXL 記憶體擴充與池化路線,Marvell 宣稱單一 CXL 交換器後方就能串起 48TB 的記憶體池——機櫃等級的記憶體共享,讓多張 GPU 共用一缸水,而不是各挖各的井。

再往上一層,Photonic Fabric 用光學互連把共享記憶體推到 pod(機群)等級,最高可達 32TB 的溫 KV Cache 卸載空間,官方數據是能讓 token 吞吐量提升 2 到 3 倍。這套「HBM → CXL → 光學共享」的三層架構,等於把記憶體從「綁在伺服器裡」解放成「在機櫃、機群間流動的資源」,正是 Agentic AI 那種多輪、長上下文、並發代理場景最需要的彈性。

Agentic AI 記憶體分層架構圖從 HBM、Structera X CXL 記憶體池、Bravera SC6 PCIe 6.0 SSD 到 Photonic Fabric 光學共享記憶體的四層 KV Cache 分流架構,容量逐層放大、延遲逐層增加。Agentic AI 記憶體分層:KV Cache 的四級分流HBM(GPU 內建)低延遲 / 最高頻寬容量最小Structera X(CXL 記憶體池)機櫃級記憶體擴充與池化單一交換器 48TBBravera SC6(PCIe 6.0 SSD)KV Cache 卸載至 SSD 層2 倍效能 / Q4 送樣Photonic Fabric(光學共享)pod 級光學互連共享記憶體32TB / 吞吐 2–3 倍

白話一點講:過去一張 GPU 的記憶體像「個人水壺」,喝完了就得回頭裝水;現在 CXL 讓整排機櫃變成「水塔」,光學共享更是直接把整棟大樓的管線打通。Agentic AI 的代理們並發跑任務時,這套機制能讓記憶體在熱點之間即時調度,而不是排隊乾等。

2026–2027 記憶體市場上看 1.28 兆美元,供應鏈與企業該如何接招?

TrendForce 在最新報告中把 2026 全球記憶體市場估值從 5,516 億美元一口氣上修到 8,893 億美元,2027 更上看 1.28 兆美元、年增約 44%;NAND flash 2027 年預估也將逼近 3,794 億美元。背後推手正是 Agentic AI 帶來的結構性需求擴張。Gartner 同樣丟出震撼彈:2026 全球 AI 支出達 2.59 兆美元、年增 47%,AI 基礎設施支出將從 2025 年的 9,756 億美元,一路漲到 2027 年的 1.89 兆美元。

全球記憶體市場規模 2025–2027 預測圖TrendForce 數據:2026 年全球記憶體市場約 8,893 億美元,2027 年上看 1.28 兆美元、年增約 44%,2025 年為基期約 5,000 億美元量級。全球記憶體市場規模(單位:美元)0.35T0.7T1.05T1.4T≈5,000 億2025 基期8,893 億20261.28 兆2027資料來源:TrendForce(2026 年 5 月預測)

對供應鏈來說,這是「漲價週期」與「架構重構」疊加的時刻:HBM 繼續供不應求、NAND 價格上揚、CXL 生態系開始成形。對企業來說,2026 下半年到 2027 正是導入記憶體分層架構的黃金窗口——現在不規劃,等 KV Cache 把預算吃穿就來不及了。

Pro Tip|專家見解:建議把「記憶體總持有成本(TCO per token)」當成 2026 年 IT 採購的核心 KPI,而不是只看單顆 GPU 或 SSD 的單價。以 48TB CXL 池與 32TB 光學共享換算下來的單位容量成本,往往比盲目加 HBM 便宜一個數量級。

常見問題 FAQ

Q1:Agentic AI 推理的記憶體瓶頸到底卡在哪裡?

A:主要卡在 KV Cache。Agentic AI 的多輪推理、長上下文與工具呼叫會讓 KV Cache 快速膨脹、吃掉 GPU 記憶體;傳統 server-attached 架構又無法彈性擴充,因此需要 HBM、CXL 記憶體池與 SSD 卸載的分層方案來解套。

Q2:Marvell 在 FMS 2026 端出了哪些 AI 記憶體與儲存產品?

A:三大主力:Bravera SC6(PCIe 6.0 SSD 控制器,效能為 SC5 兩倍,2026 Q4 送樣)、Structera X(CXL 記憶體擴充與池化,單一交換器可達 48TB)、Photonic Fabric(pod 級光學共享記憶體,最高 32TB KV Cache 卸載、token 吞吐提升 2–3 倍)。

Q3:企業什麼時候該導入 CXL 記憶體池化?

A:當你的推理工作負載 KV Cache 佔比高、HBM 成本失控、且有多租戶或多代理並發需求時,就值得導入。CXL 產品將在 2026 Q4 陸續送樣、2027 年進入規模化,建議現在就開始 POC 測試。

你的 AI 基礎設施,準備好迎接 2027 的記憶體時代了嗎?

算力軍備競賽的下半場,比的是誰能把 KV Cache 管得聰明、把記憶體成本壓得夠低。無論你是正在規劃推理叢集的架構師,還是被 HBM 預算追著跑的 IT 決策者,現在就是盤點記憶體分層策略的最佳時機。讓專業顧問幫你算出真正的 TCO per token,別讓記憶體荒吃掉你的 AI 毛利。

立即預約一對一架構諮詢 →

Share this content: