神经网络 · 第 07 条 · 训练机制
训练一个大模型需要什么
训练一个大模型需要三样东西同时到位:足够的数据、足够的算力,以及一组能收敛的超参数。缺任何一个都做不成。
规模定律
一个被反复验证的经验规律是:模型的损失,随着参数量、数据量和训练算力的增加,呈幂律下降——也就是说,规模越大效果越好,但每提升一点,需要投入的规模成倍增长。
这个规律的价值不在于「大就是好」,而在于它让训练变得可以规划:给定一个算力预算,可以算出参数量和数据量怎么分配最划算。
规模定律最重要的推论是:算力预算决定了研究节奏。如果一次实验要烧掉大量算力,你一年只能试几次;如果实验便宜,你可以试几百次。很多「研究能力」的差异,本质上是实验次数的差异。
三个容易被低估的难点
数据
数据不只是「量」,还有质量、去重、配比和清洗。重复的数据会让模型记住特定文本;低质量数据会教坏模型;不同来源的配比会显著影响模型的能力倾向。
实践中,大部分「模型效果不好」最后都追溯到数据问题,而不是模型结构。
稳定性
训练几周、用几千张卡,中间任何一次数值溢出、通信失败、节点故障都会中断。而恢复训练、调参、排查 bug 往往占据整个项目的大部分时间。
大模型训练里,「能不能跑完」比「想法好不好」更常成为瓶颈。
超参数
学习率、批大小、权重衰减、各种初始化方式——它们的组合空间非常大,而且在小规模上验证有效的一组参数,在放大规模后经常失效。这意味着大模型的超参数往往要在真实规模上重新调,成本极高。
一个反直觉的取舍
在固定算力预算下,有两个极端的做法:训一个很大的模型但只喂少量数据,或者训一个较小的模型但喂大量数据。
研究显示:对推理成本敏感的场景,后者往往更划算——模型小得多,推理便宜,效果只是略差。这也是为什么近年的模型有「参数量不涨但数据量大涨」的趋势。
和基础设施的关系
规模定律直接给出了算力需求:参数量和数据量乘以系数,就是需要的浮点运算次数。这意味着「要训练多大的模型」这个技术问题,会直接换算成一个资本开支问题——这就是后面「AI 基础架构」那条线的入口。
要点回顾
- 规模定律:损失随参数量、数据量、算力呈幂律下降,让训练可以按预算规划。
- 算力预算决定了能试多少次实验,这往往是研究能力的真正分水岭。
- 三大难点低估:数据质量与配比、训练稳定性、超参数在大规模下失效。
- 固定算力下,「小模型 + 多数据」往往比「大模型 + 少数据」更划算,尤其对推理成本敏感的场景。
- 规模定律把技术问题直接换算成了资本开支问题。