预训练:学会语言本身
预训练的目标很简单:给定前文,预测下一个词。在海量文本上反复做这件事,模型就会习得语法、事实、推理模式的统计规律。
但一个只做过预训练的模型,不会「回答问题」——它只会「续写」。你问它问题,它可能续写出更多问题的形式,因为那也是一种合理的续写。它有能力,但没有行为规范。
后训练:塑造成助手
后训练(post-training)是第二阶段,通常分两步:
- SFT(监督微调):用「问题—理想回答」的样本继续训练,教模型「该以什么形式回答」。这一步主要教格式和风格。
- RLHF / 偏好对齐:让模型生成多个回答,由人来排序,训练一个「打分模型」,再用它来优化主模型。这一步教的是「什么样的回答更好」。
对齐的目标函数是人定的,因此必然带有价值判断。「什么是有帮助的」「什么是安全的」「什么时候该拒绝」——这些不是从数据里自然浮现的,而是标注者和设计者的选择。这一点值得清楚意识到。
能力与对齐的张力
后训练会收窄模型的行为分布——把那些「奇怪但可能有创造力」的输出压下去,让回答更规范。这个过程的代价是:多样性和某些边缘能力可能同时下降。
这种张力是真实存在的,也是业界争论的焦点之一:对齐到什么程度、牺牲多少能力、由谁来定义「好」。
为什么这一步特别关键
因为用户直接接触到的,是对齐之后的模型,不是预训练模型。同一个基座模型,用不同的后训练数据和对齐策略,可以做出性格、风格、拒绝边界完全不同的产品。
这也解释了为什么「基座模型差不多」的几家公司,产品体验可以差很多——差异主要在后训练这一层。
一个实用视角
如果你想理解某个模型为什么「有时候不肯回答某些问题」或者「回答风格是这样」,答案通常不在它的参数量或架构里,而在它的后训练数据和对齐目标里。
要点回顾
- 预训练目标只有一个:预测下一个词。它给模型能力,但不给行为规范。
- 后训练分两步:SFT 教格式和风格,RLHF 教偏好排序。
- 对齐的目标函数由人定义,必然包含价值判断,不是从数据里自然浮现的。
- 对齐会收窄行为分布——提升规范性的同时可能牺牲多样性和部分边缘能力。
- 用户接触到的永远是对齐后的模型,所以产品差异主要来自后训练层,而不是基座模型。