×
In

一顆 2000W 的 XPU,一座 1GW 的資料中心,中間竟然藏著 1.5 萬顆晶片的部署差距?這不是算術題,這是 NVIDIA 最新發表的 NVHBM 架構正在解決的真實瓶頸。傳統 HBM 記憶體控制器長期佔用先進製程運算裸片的寶貴面積,就像是在黃金地段蓋了停車場——不是不能停,但空間利用實在讓人心痛。NVIDIA 這次直接把控制器搬到 HBM 堆疊裡,看似只是位置的挪動,背後卻是一連串牽動效能、功耗、甚至整個資料中心投資報酬率的連鎖反應。

控制器搬家,為何能同時滿足效能與「瘦身」?

先弄清楚一件事:傳統 HBM 設計中,記憶體控制器必須跟運算核心搶同一塊先進製程裸片的面積。這塊裸片是用昂貴的 5nm、3nm 製程打造的,每平方毫米的成本高得驚人。結果你卻得割出一大塊來放控制器,等於用頂級牛肉的價格買了塊骨頭——能吃,但肉少。

NVHBM 的突破在於,它把控制器直接整合進 HBM 堆疊內部,運算裸片完全不用再為控制器留位置。根據 NVIDIA 公布的官方數據,這套新架構能釋放高達 25% 的額外可用矽片空間。換句話說,同樣的晶片面積,現在可以塞進更多運算核心或更大容量的快取記憶體。

不過,光是移動控制器還不夠。NVIDIA 同時設計了一套客製化的實體介面(PHY),將 I/O 面積相較於標準 JEDEC HBM4E 規範縮減了 67%。這個數字乍看之下是硬體規格,但實際意義在於:中介層(Interposer)的走線限制大幅降低,整體封裝佈局變得更有彈性。對於需要在運算裸片周圍塞進多組 HBM 堆疊的旗艦加速處理器來說,這項改動的價值甚至不亞於頻寬提升本身。

編輯觀點:從產業面來看,NVHBM 最聰明的地方不在於技術指標多漂亮,而在於它重新定義了「誰該負責什麼」。過去記憶體控制器是運算晶片的工作,現在 NVIDIA 把它外包給記憶體堆疊。這種架構思維的轉變,長期來看可能比 30% 的頻寬提升更具破壞性——它讓運算裸片回歸到「專心做運算」的本質。如果這套架構被業界廣泛接受,未來我們可能會看到更多功能模組從主晶片移出的趨勢,不只限於記憶體控制器。

從單顆晶片到整座機房:15% 功耗節省的放大效應

NVHBM 實現了 HBM 運作功耗降低 15%,這個數字單獨看或許不驚人,但把它放進資料中心的場景中,意義就完全不同了。

NVIDIA 給了一個具體的試算:假設一座頂級 AI 資料中心的總用電規模達到 1GW(相當於一座核電機組的發電量),採用單顆功耗 2000W 的 XPU。透過 NVHBM 節省下來的電力與散熱餘裕,理論上可以額外支援部署高達 1.5 萬顆 XPU。這不是小數目——1.5 萬顆 XPU 的算力差距,足以決定一家雲端服務商在 AI 軍備競賽中是領先還是落後。

說真的,我們常討論 AI 晶片的效能有多強,但資料中心營運者真正在算的,從來不是「這顆晶片有多快」,而是「這間機房能塞進多少算力、每單位算力的營運成本是多少」。NVHBM 在功耗和面積上的雙重優化,正好打在這個痛點上。它不只是在幫晶片「瘦身」,更是在幫資料中心的財務報表「瘦身」。

5.2TB/s 的理論頻寬怎麼來?三星 HBM4E 是關鍵拼圖

NVIDIA 宣稱 NVHBM 能實現最高 30% 的記憶體頻寬提升,但這個數字不是憑空變出來的。我們先看基礎:三星在 Hot Chips 2026 大會上已經確認,正在準備出貨單引腳傳輸速率 16Gbps 的 HBM4E 晶片,高於目前主流的 14Gbps 版本。現行 14Gbps 的 HBM4E 透過 2048 個引腳,每堆疊可提供 3.6TB/s 的頻寬;16Gbps 版本則將單堆疊頻寬推向 4TB/s。

如果把 NVHBM 宣稱的 30% 額外頻寬提升疊加上去,單組 NVHBM 堆疊的理論頻寬最高可達 5.2TB/s。這是一個什麼概念?目前市場上最高規格的 HBM3E 解決方案大約落在 1.2TB/s 左右,5.2TB/s 是將近四倍的差距。當然,這是理論峰值,實際系統中還會有各種瓶頸,但這個數字已經足夠讓競爭對手感受到壓力。

根據三星官方公布的資訊,16Gbps 版本的 HBM4E 晶片正在準備出貨,較現行 14Gbps 版本有顯著躍升。結合 NVIDIA NVHBM 架構的 30% 頻寬提升,單堆疊理論頻寬可達 5.2TB/s 等級——這個速度已經逼近某些低階 GPU 的整體記憶體頻寬。

有趣的是,NVIDIA 這次並未將 NVHBM 綁定為獨家規格,而是開放接受多家記憶體晶片供應商的相容性驗證。這個策略很務實——如果只有一家記憶體廠商能供貨,供應鏈風險太高;開放多家驗證,既能壓低採購成本,也能確保終端客戶的供貨穩定。

亞馬遜 Annapurna Labs 率先上車,雲端自研晶片將成關鍵戰場

目前第一家公開確認導入 NVHBM 技術的合作夥伴是亞馬遜旗下的客製化晶片設計部門 Annapurna Labs。這家以 AWS Graviton 處理器和 Trainium、Inferentia AI 加速器聞名的團隊,向來走的是務實路線——效能要夠,成本要低,部署要快。Annapurna Labs 願意在第一時間跟進 NVHBM,說明這項技術已經通過了雲端服務商最嚴格的成本效益評估。

從 AWS 的角度來看,導入 NVHBM 的效益很直接:同樣的機櫃空間和電力預算,可以塞進更多 AI 訓練或推論晶片,直接轉化為更多的算力租賃收入。對於正在大規模建置 AI 基礎設施的雲端巨頭來說,這種「每瓦效能」和「每坪效能」的優化,比單純追求單晶片峰值效能更有商業意義。

NVHBM 的真正意義:重新定義晶片分工的界線

如果我們把 NVHBM 放在更大的技術脈絡下來看,它其實反映了半導體產業一個更深層的趨勢:晶片設計正在從「單一晶片塞進所有功能」轉向「模組化分工,各自最佳化」。運算裸片專注於運算,記憶體堆疊專注於儲存與頻寬,中介層負責連接——每個環節都用最適合的製程和架構來生產,再透過先進封裝技術整合在一起。

話說回來,這套架構也不是沒有挑戰。客製化 PHY 和控制器內置意味著 NVIDIA 需要與記憶體供應商進行更深入的協作,技術整合的難度比標準 JEDEC 規格高出不少。另外,開放多家記憶體廠商驗證雖然分散了風險,但也考驗 NVIDIA 在生態系管理上的功力——畢竟每家廠商的製程和特性都不太一樣,要確保一致的效能和可靠度並不容易。

不過,對於正在激烈競爭 AI 晶片市場的 NVIDIA 來說,NVHBM 提供了一個明確的差異化優勢。當競爭對手還在追趕標準 HBM4E 的頻寬規格時,NVIDIA 已經用客製化架構多擠出了 30% 的效能和 25% 的面積紅利。在 AI 訓練模型規模每幾個月就翻倍的時代,這種「每一分矽片面積都要榨出極致效能」的思維,恐怕是維持領先的必要條件。

對一般讀者來說,NVHBM 的影響其實比你想像的更近。它不會直接出現在你的桌機或筆電裡,但當你在使用 ChatGPT、Claude 或任何雲端 AI 服務時,背後支撐這些服務的資料中心,很可能在未來幾年內陸續導入這項技術。更低的營運成本、更高的算力密度,最終會反映在雲端服務的價格和品質上。換句話說,NVHBM 節省下來的每一度電和每一平方公分的晶片面積,最後都可能變成你訂閱 AI 服務時少付的幾塊錢、或是更流暢的回應速度。

本文改寫整理自公開新聞來源,原始報導由T客邦發布。

常見問題 FAQ

NVHBM 跟現在市面上的 HBM 有什麼不同?

最大的差異在於記憶體控制器的位置。傳統 HBM 的控制器配置在運算裸片上,會佔用寶貴的先進製程面積;NVHBM 則將控制器移入 HBM 堆疊內部,釋放運算裸片面積用於更多核心或快取,同時透過客製化 PHY 進一步縮小 I/O 面積。

5.2TB/s 的頻寬是怎麼算出來的?

以三星 HBM4E 16Gbps 版本為基礎,單堆疊透過 2048 個引腳可達 4TB/s 頻寬,再疊加 NVHBM 宣稱的 30% 頻寬提升幅度,理論值即為 5.2TB/s。這是實驗室理論峰值,實際系統效能會受到封裝、散熱和整體系統架構影響。

NVHBM 什麼時候會實際出貨?

NVIDIA 尚未公布具體的量產時程表,但考量到亞馬遜 Annapurna Labs 已率先成為合作夥伴,且三星 HBM4E 16Gbps 版本正準備出貨,外界普遍預期 NVHBM 相關產品將在未來一到兩年內陸續問世,實際時程仍須以官方公告為準。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

Related Posts