回到 AI 記憶體策展
AI MEMORY · EP08 · AI 把需求搬家 · AI 推理 · PDF 第 16、17、18

KV Cache 是什麼?AI Agent 的長期記憶,正在吃掉更多 SSD 與 DRAM

模型每生成一個 token,都不想把前文重算一次。KV Cache 保存上下文,卻會隨序列與併發量擴張,迫使資料從 HBM 外溢到 DRAM、SSD 與共享儲存。

為什麼 AI 需要快取前文?

Transformer 在推理時要參考先前 token 的注意力資訊。如果每生成一個新 token 都重新計算全部歷史,序列愈長,浪費的運算愈大。KV Cache 把已計算的 Key 與 Value 保存下來,讓下一步直接重用。

這個機制用容量換速度。單一短對話不明顯,但當上下文變長、使用者增加、Agent 需要記住工具結果與中間步驟,KV Cache 會隨序列與併發規模擴張。快取命中率、保存時間與可否跨服務共享,開始直接影響每個 token 的成本。

因此 AI Agent 的『記憶』不只是軟體功能,也是一張硬體帳單。模型愈會長時間工作,就愈需要設計快取生命週期與存儲階層。

KV CACHE

上下文快取如何逐層外溢

容量增大時,活躍快取從 HBM 移向 DRAM、SSD 與共享儲存。

G1 · HBM納秒級直接生成 token
G2 · DRAM近端外溢擴大有效容量
G3.5 · Context memory150TB 池彌合 GPU 與共享儲存
G4 · Shared storage毫秒級持久、低頻資料

G3.5 為 NVIDIA BlueField-4 上下文記憶層。資料來源:NVIDIA、財信證券,PDF 第 16–17 頁。

從 G1 到 G4:愈往下,容量愈大、延遲愈高

報告整理的階層由 GPU HBM(G1)、系統 DRAM(G2)、本地 SSD(G3)到共享物件/檔案儲存(G4)。HBM 是納秒級、最適合活躍快取,但容量昂貴;DRAM 與 SSD 提供更大空間,延遲與能源成本也逐層增加;共享儲存適合低頻與持久資料。

問題出在 G3 與 G4 之間:本地 SSD 容量有限,共享儲存延遲太高。NVIDIA 以 BlueField-4 DPU 建立專用上下文記憶層 G3.5,讓 4 顆 DPU 管理 150TB 記憶池並直連 GPU。報告指出,這種設計可讓每顆 GPU 額外取得 16TB 上下文空間。

最具體的需求變化是,單機櫃 NAND 配置可能由 830TB 上升到接近 2PB。AI 推理對 NAND 的價值,正從資料保存延伸到上下文記憶基礎設施。

VERA RUBIN NVL72

一座 AI 機櫃的記憶體配置

每一代平台都在提高靠近運算單元的容量與頻寬。

72 × Rubin GPU20.7TBHBM4 總容量
HBM4 bandwidth1.6PB/s單櫃總頻寬
Vera CPU memory54TBLPDDR5X 總容量
Context NAND830TB → 近 2PB報告所述架構情境

平台規格與報告情境值,不等同所有客戶實際配置。資料來源:NVIDIA、財信證券,PDF 第 17–18 頁。

這個題材要怎麼驗證?

首先看平台是否正式量產,以及機櫃配置是否從參考設計變成客戶採購。其次看企業級 SSD 的容量、介面、主控與韌體規格,能否承受高頻讀取、可預測延遲與資料共享。

第三要看軟體是否把快取分層做好。若模型壓縮、快取量化、稀疏注意力或更有效的上下文管理大幅降低容量,需求成長可能低於硬體線性外推。KV Cache 是重要增量,但估算必須跟模型架構與推理軟體一起更新。

  • 容量:上下文長度、併發 token 與保存時間。
  • 效率:快取命中率、量化、壓縮與淘汰策略。
  • 硬體:HBM、DRAM、SSD 與共享儲存的成本曲線。
  • 落地:平台量產、客戶採用與企業級認證。

資料來源與口徑

  • 財信證券《AI 引爆存儲需求,供給約束支撐行業高景氣周期:存儲行業深度報告》,2026 年 8 月 12 日;本文主要引用 PDF 第 16、17、18 頁。
  • 原報告另引用 TrendForce、CFM、Counterpoint、NVIDIA、YOLE、弗若斯特沙利文及公司公告等來源;E/F 表示預估。
  • 市場份額、產能、合約價與技術規格有特定時點及口徑;跨來源數字不宜直接相加。

這篇是「AI 記憶體超級周期」第 8 篇。產業景氣會替公司加分,產品、客戶與現金流才決定分數能留多久。

回到 20 篇系列首頁 · 更多 XMY 觀點與研究

本文為產業研究與個人觀點整理,不構成投資建議;預估與公司資訊請以最新公開資料為準。

上一篇:QLC SSD 會取代 Nearline HDD 嗎?AI 資料中心開始算另一筆帳

下一篇:Vera Rubin 一座機櫃要多少記憶體?AI 算力正在用容量換效率