AI 基础架构 · 第 03 条 · 硬件
HBM 与存储层级
从寄存器到硬盘,每一级存储之间都差一个数量级的速度。AI 芯片的性能竞争,很大一部分就发生在「怎么把数据搬到离计算更近的地方」。
存储层级
| 层级 | 容量量级 | 访问速度 | 特点 |
|---|---|---|---|
| 寄存器 | KB | 极快 | 直接在计算单元里 |
| 片上缓存(SRAM) | MB | 很快 | 贵,占芯片面积 |
| 显存(HBM) | GB–百 GB | 较快 | 容量与带宽的平衡点 |
| 系统内存(DRAM) | 百 GB–TB | 慢一个量级 | 容量大但带宽低 |
| 本地存储(SSD) | TB–PB | 慢很多 | 几乎只用于存放 |
| 网络存储 | PB+ | 最慢 | 跨机器 |
每一级之间都差一个数量级左右。整个 AI 系统的性能问题,很大程度就是「如何在正确的时间、把正确的数据、放在正确的层级上」。
HBM 解决的是什么
普通显存(GDDR)通过提高频率来增加带宽,但频率有物理上限。HBM 换了一个思路:把多块内存芯片垂直堆叠起来,通过硅通孔(TSV)连接,再通过很宽的总线和大芯片直连。
结果是:用「更宽」代替「更快」。位宽大得多,即使频率不极致,总带宽也能大幅提升。而且堆叠让它离计算单元更近,功耗也更低。
HBM 的难点不在设计,在制造。堆叠多层芯片、打上万条微小的硅通孔、保证良率——这些工艺难度让全球能稳定量产 HBM 的厂商极少。这直接决定了整条 AI 算力供应链的节奏。
为什么它成了瓶颈环节
因为需求增长太快:AI 服务器对 HBM 的需求增速远高于整体存储市场,而 HBM 的生产要占用常规 DRAM 的产能(同样的晶圆面积,做 HBM 产出的比特数更少)。
结果是产能被虹吸——AI 吃掉的晶圆,会挤压消费级存储的供给,进而推高手机、笔记本的内存成本。这是一个典型的「上游需求改变下游价格」的链条,也是本站行业研究里写过的那类传导。
和带宽那条的联系
回到上一条:推理受带宽限制时,最直接的解法就是提高带宽。HBM 就是这个解法。所以「AI 芯片的竞争」,在硬件层面可以简化成一句话:谁的芯片能更快地把权重喂给计算单元。
要点回顾
- 存储层级每一级之间差一个数量级,系统性能问题本质是数据放置问题。
- HBM 用「位宽换频率」:垂直堆叠 + 宽总线,实现高带宽低功耗。
- HBM 的难点在制造(堆叠、硅通孔、良率),全球可稳定量产的厂商极少。
- HBM 产能会虹吸常规 DRAM 产能,推高消费级存储价格——这是可追踪的产业传导链。
- AI 芯片的硬件竞争,可以简化为「谁能更快把权重喂给计算单元」。