Vera Rubin 一座機櫃要多少記憶體?AI 算力正在用容量換效率
報告整理 Rubin GPU 每顆 288GB HBM4、單櫃 HBM 20.7TB、LPDDR5X 54TB,以及接近 2PB 的 NAND 情境。每一代平台都在把更多資料留在運算附近。
一座 AI 機櫃,其實是一個記憶體系統
依報告整理的 NVIDIA 平台參數,每顆 Rubin GPU 配置 288GB HBM4、頻寬 22TB/s;72 顆 GPU 的 NVL72 機櫃,HBM 合計約 20.7TB、總頻寬約 1.6PB/s。與 Blackwell 相比,容量約 1.5 倍、頻寬約 2.8 倍。
Vera CPU 又提供每顆 1.5TB LPDDR5X,單櫃合計約 54TB,作為 HBM 之外的近端記憶體層。若再納入上下文記憶池與 SSD,整座機櫃會形成從極高速、小容量到較慢、大容量的連續階層。
這些數字的真正含義是:運算單元增加時,記憶體必須同步擴容,否則更多 FLOPS 只會等待資料。AI 平台賣的已不是單顆 GPU,而是計算、互連、記憶體與儲存共同優化的系統。
一座 AI 機櫃的記憶體配置
每一代平台都在提高靠近運算單元的容量與頻寬。
平台規格與報告情境值,不等同所有客戶實際配置。資料來源:NVIDIA、財信證券,PDF 第 17–18 頁。
模型權重與 KV Cache,分別吃掉靜態和動態空間
模型權重是相對靜態的記憶體需求,活躍參數必須靠近 GPU 以維持回應效率;KV Cache 則隨使用者、序列長度與對話內容動態增加。前者決定模型能不能放得下,後者決定服務擴張時成本會不會失控。
報告引述一組 GPT-5 推理情境估算,HBM 需求主要由模型權重與 KV Cache 組成,DRAM 則承接更大量的快取外溢。這類估算高度依賴模型參數、MoE 活躍比例、精度、GQA、併發 token 與快取重用率,因此應視為架構說明,而非固定採購預測。
對產業而言,方向比單一絕對值更可靠:模型愈大、上下文愈長、推理量愈高,整個記憶體階層都要升級;軟體效率則會抵銷部分硬體需求。
AI 推理不是一種記憶體,而是一整座階層
愈靠近 GPU 愈快、愈貴;愈往下容量愈大、延遲愈高。
概念重製。資料來源:NVIDIA、財信證券,PDF 第 11、16–18 頁。
觀察平台升級,要看每個 token,不只看每座機櫃
新平台單櫃更貴、功耗更高,但若每秒 token、每瓦 token 與每美元 token 改善,CSP 仍有採購動機。記憶體擴容的價值,就在於提高加速器利用率並降低資料等待。
投資人可以固定追蹤每 GPU HBM 容量/頻寬、CPU 記憶體、NAND 配置、互連頻寬、機櫃功耗與推理效能。平台發布會會給出峰值,實際部署還要經過供應、良率、散熱、軟體與客戶驗證。先分清理論規格與量產出貨,才能避免被漂亮表格催眠。
資料來源與口徑
- 財信證券《AI 引爆存儲需求,供給約束支撐行業高景氣周期:存儲行業深度報告》,2026 年 8 月 12 日;本文主要引用 PDF 第 17、18 頁。
- 原報告另引用 TrendForce、CFM、Counterpoint、NVIDIA、YOLE、弗若斯特沙利文及公司公告等來源;E/F 表示預估。
- 市場份額、產能、合約價與技術規格有特定時點及口徑;跨來源數字不宜直接相加。
這篇是「AI 記憶體超級周期」第 9 篇。產業景氣會替公司加分,產品、客戶與現金流才決定分數能留多久。
本文為產業研究與個人觀點整理,不構成投資建議;預估與公司資訊請以最新公開資料為準。