学习 / 神经网络 / 08

神经网络 · 第 08 条 · 后训练

微调、对齐与 RLHF

预训练让模型学会说话,后训练让它学会「该怎么说」。这两个阶段的目标完全不同,甚至有时互相拉扯。

难度 入门约 13 分钟前置:1 条更新 2026-09-28

预训练:学会语言本身

预训练的目标很简单:给定前文,预测下一个词。在海量文本上反复做这件事,模型就会习得语法、事实、推理模式的统计规律。

但一个只做过预训练的模型,不会「回答问题」——它只会「续写」。你问它问题,它可能续写出更多问题的形式,因为那也是一种合理的续写。它有能力,但没有行为规范。

后训练:塑造成助手

后训练(post-training)是第二阶段,通常分两步:

对齐的目标函数是人定的,因此必然带有价值判断。「什么是有帮助的」「什么是安全的」「什么时候该拒绝」——这些不是从数据里自然浮现的,而是标注者和设计者的选择。这一点值得清楚意识到。

能力与对齐的张力

后训练会收窄模型的行为分布——把那些「奇怪但可能有创造力」的输出压下去,让回答更规范。这个过程的代价是:多样性和某些边缘能力可能同时下降。

这种张力是真实存在的,也是业界争论的焦点之一:对齐到什么程度、牺牲多少能力、由谁来定义「好」。

两个阶段,教的是完全不同的东西预训练目标:预测下一个词学到:语法、事实、推理模式结果:有「能力」但没有「行为规范」后训练SFT 教格式 → RLHF 教偏好学到:该怎么回答结果:能用、可控、有边界代价:行为分布变窄用户接触到的永远是对齐之后的那一个 —— 所以「基座模型差不多,产品体验差很多」是正常的对齐的目标函数是人定的,必然带价值判断,不是从数据里自然浮现的
左边给能力,右边给规范。注意两边最后一行的对比:预训练结束时模型有本事但没规矩;后训练之后能用了,代价是行为分布变窄(多样性和部分边缘能力会下降)。这就是「能力 vs 对齐」的张力。

为什么这一步特别关键

因为用户直接接触到的,是对齐之后的模型,不是预训练模型。同一个基座模型,用不同的后训练数据和对齐策略,可以做出性格、风格、拒绝边界完全不同的产品。

这也解释了为什么「基座模型差不多」的几家公司,产品体验可以差很多——差异主要在后训练这一层。

一个实用视角

如果你想理解某个模型为什么「有时候不肯回答某些问题」或者「回答风格是这样」,答案通常不在它的参数量或架构里,而在它的后训练数据和对齐目标里。

要点回顾
← 训练一个大模型需要什么 幻觉从哪来 →