学习 / AI 基础架构 / 07

AI 基础架构 · 第 07 条 · 优化

量化与蒸馏:把模型塞进更小的盒子

用一点精度换大量的成本,是推理侧最现实的工程手段。量化与蒸馏这两条路,直接决定了推理生意的毛利。

难度 入门 → 进阶约 12 分钟前置:1 条更新 2026-09-28

量化:降低数字的精度

模型参数本来是 16 位或 32 位浮点数。如果换成 8 位、甚至 4 位整数,会带来三个直接好处:

所以量化对推理的收益是「三重叠加」的:不仅省显存,还直接缓解了那个最紧的瓶颈——带宽。

量化的代价是精度损失,但损失通常不均匀。有些层、有些权重对精度极其敏感(量化了效果明显变差),另一些几乎无感。所以好的量化方案是「混合的」——关键部分保持高精度,其余部分压到很低。
降低精度 = 同时省显存、省带宽、提速度FP32100% 显存训练基准FP16 / BF1655.00000000000001% 显存训练常用INT832% 显存推理常用INT420% 显存推理激进档代价是精度损失,但不同层的敏感度差别很大 → 所以好的方案是「混合精度」:关键部分保持高精度
条形长度就是显存占用。从 FP16 降到 INT4,占用只剩八分之一,而推理恰恰卡在带宽上,所以量化是三重收益。但注意最下面那条:精度不是可以无限降的,而且不同层敏感度差别很大,所以实际用的是混合精度。

蒸馏:把行为搬过去

蒸馏的做法不是压缩原模型,而是训练一个更小的模型去模仿大模型的输出。

关键在于「模仿什么」:不只是模仿最终答案,更重要的是模仿大模型的输出分布——比如它给错误选项分配了多少概率。这个信息比「正确答案是什么」丰富得多,能让小模型学到更多结构。

蒸馏的收益是推理成本的大幅下降(小模型跑得又快又便宜),代价是能力的上限受限于小模型本身。

两者解决的不是同一个问题

量化蒸馏
做什么降低数值精度训练小模型模仿大模型
模型结构不变变了(更小)
主要收益显存 + 带宽 + 速度整体推理成本
主要代价精度下降(可控)能力上限下降
可否叠加可以,常与蒸馏同时使用

为什么它决定毛利

推理成本 = 单位算力成本 × 需要的算力。量化直接降低「需要的算力」,而且是通过降低带宽压力这个最紧的瓶颈来降的。

在推理单位经济里,量化和蒸馏通常是成本下降幅度最大的两个杠杆——因为它们不依赖硬件升级,纯靠算法和工程就能拿到收益。

但也别高估:量化的收益有上限(精度不能无限降),蒸馏的能力损失是真实的。它们是把成本曲线往下推,而不是把成本变成零。

要点回顾
← 训练与推理:两种完全不同的负载 数据中心的电和水 →