学习 / AI 基础架构 / 02

AI 基础架构 · 第 02 条 · 性能

显存带宽为什么是真正的瓶颈

为什么算力明明够,模型却跑不快?因为大部分时间花在等数据,而不是算数据。

难度 入门 → 进阶约 12 分钟前置:1 条更新 2026-09-28

算力与带宽的比例

芯片做一次运算的速度是固定的,但要把数据从显存取到计算单元,需要时间。这两者的比值决定了一块芯片实际能跑多快。

算术强度 = 运算次数 ÷ 数据搬运量
如果一次数据搬运能被用来做很多次运算(算术强度高),算力就是瓶颈;
如果搬一次数据只够做很少运算(算术强度低),带宽就是瓶颈,再多的算力也没用。

大模型推理里,生成每个 token 都需要把模型的权重从显存读一遍。如果批很小,读一遍权重只能生成一个 token——算术强度极低,完全是带宽受限。这就是为什么单条对话时 GPU 利用率低。

0.111010010000%50%100%算术强度(运算 / 字节,对数轴)实际算力利用率带宽受限区算力受限区拐点 = 每字节运算数刚好喂饱算力小批量推理大批量训练
这条「屋顶线」解释了大部分性能问题。左边斜线段是带宽受限(算力够但数据喂不上),右边平线段才是算力受限。红点是小批量推理——它远在左边,所以 GPU 利用率低不是配置问题,是负载性质决定的。

怎么提高算术强度

一个容易搞混的区分

容量和带宽是两个不同的指标,经常被混为一谈。

指标含义不够会怎样
显存容量能装下多少数据模型放不下,或批大小上不去
显存带宽每秒能搬多少数据算力闲置,速度上不去

一块卡可能容量很大但带宽一般(适合放得下但不需要频繁搬的场景),也可能带宽很高但容量有限。训练和推理对这两者的需求侧重不同——训练要放得下(容量优先),推理要搬得快(带宽优先,尤其是低延迟场景)。

为什么这是理解 AI 硬件的钥匙

因为接下来几个问题都能用它解释:为什么 HBM 这么重要(它是提升带宽的主要手段)、为什么量化这么有效(它直接降低搬运量)、为什么推理芯片和训练芯片会分化(两者的算术强度完全不同)。

要点回顾
← GPU、TPU 与加速器:为什么不是 CPU HBM 与存储层级 →