AI 基础架构 · 第 07 条 · 优化
量化与蒸馏:把模型塞进更小的盒子
用一点精度换大量的成本,是推理侧最现实的工程手段。量化与蒸馏这两条路,直接决定了推理生意的毛利。
量化:降低数字的精度
模型参数本来是 16 位或 32 位浮点数。如果换成 8 位、甚至 4 位整数,会带来三个直接好处:
- 显存占用降低:同样一块卡能放更大的模型,或者用更大的批。
- 带宽需求降低:搬运的数据量少了,而推理恰恰是带宽受限的。
- 计算更快:低精度运算的硬件效率更高。
所以量化对推理的收益是「三重叠加」的:不仅省显存,还直接缓解了那个最紧的瓶颈——带宽。
量化的代价是精度损失,但损失通常不均匀。有些层、有些权重对精度极其敏感(量化了效果明显变差),另一些几乎无感。所以好的量化方案是「混合的」——关键部分保持高精度,其余部分压到很低。
蒸馏:把行为搬过去
蒸馏的做法不是压缩原模型,而是训练一个更小的模型去模仿大模型的输出。
关键在于「模仿什么」:不只是模仿最终答案,更重要的是模仿大模型的输出分布——比如它给错误选项分配了多少概率。这个信息比「正确答案是什么」丰富得多,能让小模型学到更多结构。
蒸馏的收益是推理成本的大幅下降(小模型跑得又快又便宜),代价是能力的上限受限于小模型本身。
两者解决的不是同一个问题
| 量化 | 蒸馏 | |
|---|---|---|
| 做什么 | 降低数值精度 | 训练小模型模仿大模型 |
| 模型结构 | 不变 | 变了(更小) |
| 主要收益 | 显存 + 带宽 + 速度 | 整体推理成本 |
| 主要代价 | 精度下降(可控) | 能力上限下降 |
| 可否叠加 | 可以,常与蒸馏同时使用 |
为什么它决定毛利
推理成本 = 单位算力成本 × 需要的算力。量化直接降低「需要的算力」,而且是通过降低带宽压力这个最紧的瓶颈来降的。
在推理单位经济里,量化和蒸馏通常是成本下降幅度最大的两个杠杆——因为它们不依赖硬件升级,纯靠算法和工程就能拿到收益。
但也别高估:量化的收益有上限(精度不能无限降),蒸馏的能力损失是真实的。它们是把成本曲线往下推,而不是把成本变成零。
要点回顾
- 量化降低数值精度,同时省显存、缓解带宽、提升速度——收益三重叠加。
- 精度敏感度在不同层之间差异很大,所以好的量化方案是混合精度的。
- 蒸馏是训练小模型模仿大模型的输出分布,不只是模仿答案。
- 两者可以叠加使用;量化保结构,蒸馏换结构。
- 它们是成本下降幅度最大的两个杠杆之一,因为有上限但不是零成本。