回到 AI 記憶體策展
AI MEMORY · EP09 · AI 把需求搬家 · AI 機櫃 · PDF 第 17、18

Vera Rubin 一座機櫃要多少記憶體?AI 算力正在用容量換效率

報告整理 Rubin GPU 每顆 288GB HBM4、單櫃 HBM 20.7TB、LPDDR5X 54TB,以及接近 2PB 的 NAND 情境。每一代平台都在把更多資料留在運算附近。

一座 AI 機櫃,其實是一個記憶體系統

依報告整理的 NVIDIA 平台參數,每顆 Rubin GPU 配置 288GB HBM4、頻寬 22TB/s;72 顆 GPU 的 NVL72 機櫃,HBM 合計約 20.7TB、總頻寬約 1.6PB/s。與 Blackwell 相比,容量約 1.5 倍、頻寬約 2.8 倍。

Vera CPU 又提供每顆 1.5TB LPDDR5X,單櫃合計約 54TB,作為 HBM 之外的近端記憶體層。若再納入上下文記憶池與 SSD,整座機櫃會形成從極高速、小容量到較慢、大容量的連續階層。

這些數字的真正含義是:運算單元增加時,記憶體必須同步擴容,否則更多 FLOPS 只會等待資料。AI 平台賣的已不是單顆 GPU,而是計算、互連、記憶體與儲存共同優化的系統。

VERA RUBIN NVL72

一座 AI 機櫃的記憶體配置

每一代平台都在提高靠近運算單元的容量與頻寬。

72 × Rubin GPU20.7TBHBM4 總容量
HBM4 bandwidth1.6PB/s單櫃總頻寬
Vera CPU memory54TBLPDDR5X 總容量
Context NAND830TB → 近 2PB報告所述架構情境

平台規格與報告情境值,不等同所有客戶實際配置。資料來源:NVIDIA、財信證券,PDF 第 17–18 頁。

模型權重與 KV Cache,分別吃掉靜態和動態空間

模型權重是相對靜態的記憶體需求,活躍參數必須靠近 GPU 以維持回應效率;KV Cache 則隨使用者、序列長度與對話內容動態增加。前者決定模型能不能放得下,後者決定服務擴張時成本會不會失控。

報告引述一組 GPT-5 推理情境估算,HBM 需求主要由模型權重與 KV Cache 組成,DRAM 則承接更大量的快取外溢。這類估算高度依賴模型參數、MoE 活躍比例、精度、GQA、併發 token 與快取重用率,因此應視為架構說明,而非固定採購預測。

對產業而言,方向比單一絕對值更可靠:模型愈大、上下文愈長、推理量愈高,整個記憶體階層都要升級;軟體效率則會抵銷部分硬體需求。

AI MEMORY HIERARCHY

AI 推理不是一種記憶體,而是一整座階層

愈靠近 GPU 愈快、愈貴;愈往下容量愈大、延遲愈高。

G1GPU HBM最高頻寬/最低延遲模型權重、活躍 KV
G2系統 DRAM大容量近端記憶體快取外溢
G3–3.5本地/上下文 SSDTB–PB 級容量長上下文、檢索
G4共享儲存高容量/可持久低頻資料資產

概念重製。資料來源:NVIDIA、財信證券,PDF 第 11、16–18 頁。

觀察平台升級,要看每個 token,不只看每座機櫃

新平台單櫃更貴、功耗更高,但若每秒 token、每瓦 token 與每美元 token 改善,CSP 仍有採購動機。記憶體擴容的價值,就在於提高加速器利用率並降低資料等待。

投資人可以固定追蹤每 GPU HBM 容量/頻寬、CPU 記憶體、NAND 配置、互連頻寬、機櫃功耗與推理效能。平台發布會會給出峰值,實際部署還要經過供應、良率、散熱、軟體與客戶驗證。先分清理論規格與量產出貨,才能避免被漂亮表格催眠。

資料來源與口徑

  • 財信證券《AI 引爆存儲需求,供給約束支撐行業高景氣周期:存儲行業深度報告》,2026 年 8 月 12 日;本文主要引用 PDF 第 17、18 頁。
  • 原報告另引用 TrendForce、CFM、Counterpoint、NVIDIA、YOLE、弗若斯特沙利文及公司公告等來源;E/F 表示預估。
  • 市場份額、產能、合約價與技術規格有特定時點及口徑;跨來源數字不宜直接相加。

這篇是「AI 記憶體超級周期」第 9 篇。產業景氣會替公司加分,產品、客戶與現金流才決定分數能留多久。

回到 20 篇系列首頁 · 更多 XMY 觀點與研究

本文為產業研究與個人觀點整理,不構成投資建議;預估與公司資訊請以最新公開資料為準。

上一篇:KV Cache 是什麼?AI Agent 的長期記憶,正在吃掉更多 SSD 與 DRAM

下一篇:AI 手機與 AI PC 真的會帶動換機嗎?記憶體先拿到的是規格紅利