学习 / 神经网络 / 07

神经网络 · 第 07 条 · 训练机制

训练一个大模型需要什么

训练一个大模型需要三样东西同时到位:足够的数据、足够的算力,以及一组能收敛的超参数。缺任何一个都做不成。

难度 入门约 12 分钟前置:2 条更新 2026-09-28

规模定律

一个被反复验证的经验规律是:模型的损失,随着参数量、数据量和训练算力的增加,呈幂律下降——也就是说,规模越大效果越好,但每提升一点,需要投入的规模成倍增长。

这个规律的价值不在于「大就是好」,而在于它让训练变得可以规划:给定一个算力预算,可以算出参数量和数据量怎么分配最划算。

规模定律最重要的推论是:算力预算决定了研究节奏。如果一次实验要烧掉大量算力,你一年只能试几次;如果实验便宜,你可以试几百次。很多「研究能力」的差异,本质上是实验次数的差异。
5010020050010²10³10⁴模型规模(对数轴)损失(对数轴)幂律下降:规模每翻一倍,损失下降一个固定比例两端点之间的斜率,决定了「加规模」值不值
横轴是模型规模、纵轴是损失,两个轴都是对数刻度。直线的斜率就是关键——它告诉你「规模翻一倍,损失能降多少」。斜率越陡,加大投入越划算;如果变平了,再堆规模就不值了。

三个容易被低估的难点

数据

数据不只是「量」,还有质量、去重、配比和清洗。重复的数据会让模型记住特定文本;低质量数据会教坏模型;不同来源的配比会显著影响模型的能力倾向。

实践中,大部分「模型效果不好」最后都追溯到数据问题,而不是模型结构。

稳定性

训练几周、用几千张卡,中间任何一次数值溢出、通信失败、节点故障都会中断。而恢复训练、调参、排查 bug 往往占据整个项目的大部分时间。

大模型训练里,「能不能跑完」比「想法好不好」更常成为瓶颈。

超参数

学习率、批大小、权重衰减、各种初始化方式——它们的组合空间非常大,而且在小规模上验证有效的一组参数,在放大规模后经常失效。这意味着大模型的超参数往往要在真实规模上重新调,成本极高。

一个反直觉的取舍

在固定算力预算下,有两个极端的做法:训一个很大的模型但只喂少量数据,或者训一个较小的模型但喂大量数据。

研究显示:对推理成本敏感的场景,后者往往更划算——模型小得多,推理便宜,效果只是略差。这也是为什么近年的模型有「参数量不涨但数据量大涨」的趋势。

和基础设施的关系

规模定律直接给出了算力需求:参数量和数据量乘以系数,就是需要的浮点运算次数。这意味着「要训练多大的模型」这个技术问题,会直接换算成一个资本开支问题——这就是后面「AI 基础架构」那条线的入口。

要点回顾
← 注意力机制与 Transformer 微调、对齐与 RLHF →