学习 / AI 基础架构 / 03

AI 基础架构 · 第 03 条 · 硬件

HBM 与存储层级

从寄存器到硬盘,每一级存储之间都差一个数量级的速度。AI 芯片的性能竞争,很大一部分就发生在「怎么把数据搬到离计算更近的地方」。

难度 入门 → 进阶约 11 分钟前置:1 条更新 2026-09-28

存储层级

层级容量量级访问速度特点
寄存器KB极快直接在计算单元里
片上缓存(SRAM)MB很快贵,占芯片面积
显存(HBM)GB–百 GB较快容量与带宽的平衡点
系统内存(DRAM)百 GB–TB慢一个量级容量大但带宽低
本地存储(SSD)TB–PB慢很多几乎只用于存放
网络存储PB+最慢跨机器

每一级之间都差一个数量级左右。整个 AI 系统的性能问题,很大程度就是「如何在正确的时间、把正确的数据、放在正确的层级上」。

离计算越近,越快、越小、越贵寄存器KB 级片上缓存 SRAMMB 级显存 HBMGB–百 GB系统内存 DRAM百 GB–TB本地存储 SSDTB–PB每一级之间差一个数量级← 越往上越快但容量越小AI 的性能问题,本质是「数据放对层级」
越往上越快、越小、越贵。看图能明白「为什么 AI 的瓶颈常常不是算力」——计算单元在最高的几层,但数据和权重住在下面的几层,中间每一级都要花时间搬。所谓优化,大多是在减少这种搬运。

HBM 解决的是什么

普通显存(GDDR)通过提高频率来增加带宽,但频率有物理上限。HBM 换了一个思路:把多块内存芯片垂直堆叠起来,通过硅通孔(TSV)连接,再通过很宽的总线和大芯片直连。

结果是:用「更宽」代替「更快」。位宽大得多,即使频率不极致,总带宽也能大幅提升。而且堆叠让它离计算单元更近,功耗也更低。

HBM 的难点不在设计,在制造。堆叠多层芯片、打上万条微小的硅通孔、保证良率——这些工艺难度让全球能稳定量产 HBM 的厂商极少。这直接决定了整条 AI 算力供应链的节奏。
HBM 的思路:用「更宽」代替「更快」普通显存 GDDR几片芯片并排靠提高频率提升带宽频率有物理上限HBM:垂直堆叠8 层堆叠 + 硅通孔(TSV)位宽大得多,频率不用极致离计算单元更近、功耗更低难点在制造· 多层堆叠· 上万条微孔· 良率控制→ 全球能 稳定量产的很少同样的晶圆面积,做 HBM 产出的比特更少 → 会挤占消费级存储的产能
左边是普通显存的思路(多片并排、提高频率),右边是 HBM(垂直堆叠、用硅通孔打通)。注意右边那些竖虚线——上万条微小的通孔要全部对准,这就是制造难度的来源,也是全球只有少数厂商能做出来的原因。

为什么它成了瓶颈环节

因为需求增长太快:AI 服务器对 HBM 的需求增速远高于整体存储市场,而 HBM 的生产要占用常规 DRAM 的产能(同样的晶圆面积,做 HBM 产出的比特数更少)。

结果是产能被虹吸——AI 吃掉的晶圆,会挤压消费级存储的供给,进而推高手机、笔记本的内存成本。这是一个典型的「上游需求改变下游价格」的链条,也是本站行业研究里写过的那类传导。

和带宽那条的联系

回到上一条:推理受带宽限制时,最直接的解法就是提高带宽。HBM 就是这个解法。所以「AI 芯片的竞争」,在硬件层面可以简化成一句话:谁的芯片能更快地把权重喂给计算单元。

要点回顾
← 显存带宽为什么是真正的瓶颈 训练集群怎么连起来:NVLink 与 InfiniBand →