AI 基础架构 · 第 09 条 · 经济性
单位经济:一个 token 的真实成本
把所有技术约束翻译成钱。一个 token 的成本,是理解 AI 生意能不能赚钱的落点。
成本由三块构成
| 成本项 | 性质 | 主要驱动因素 |
|---|---|---|
| 折旧 | 固定,一次性投入摊到年限 | 硬件采购价、折旧年限 |
| 电力与散热 | 随使用量变化 | 功耗、电价、利用率 |
| 运维与人力 | 半固定 | 机房、网络、团队 |
单位成本 = (折旧 + 电力 + 运维)÷ 实际产出的 token 数
分子里固定成本占大头,所以分母(实际产出)才是关键变量。
分子里固定成本占大头,所以分母(实际产出)才是关键变量。
利用率为什么这么关键
假设一块卡折旧加电费一年是 10 万块。如果它满负荷运转,一年产出 1 亿个 token,单位成本就是 0.001 元/token。如果只跑了一半,产出 5,000 万,单位成本就翻倍——分子几乎没变,分母砍半。
而这个「利用率」受前面所有技术环节的制约:带宽瓶颈会压低利用率、并行效率会压低利用率、批太小也会压低利用率。
所以前面九条讲的技术问题,最终都会在这里变成钱。
为什么推理的单位成本比训练更难算
训练成本相对好算:总的算力消耗除以一次训练的产出(一个模型)。一次性、可估算。
推理成本难在「需求波动」:用户请求有峰谷。为了应对峰值,必须准备足够的容量;但在谷时,这些容量闲置。于是实际利用率永远低于按峰值设计的容量。
- 按峰值配置 → 谷时浪费,单位成本高
- 按均值配置 → 峰时排队,体验差
- 理想解是削峰填谷(比如把离线任务放在低谷跑)——这也是为什么很多平台要同时服务在线和离线负载
几个能显著改善单位成本的杠杆
- 提高利用率:连续批处理、混合在线/离线负载、调度优化。
- 降低单次计算量:量化、蒸馏、更高效的模型结构。
- 降低硬件成本:更便宜的芯片、更长的折旧年限(但要合理)、更低的电价。
- 提高缓存命中:相同的输入前缀可以复用中间结果,这在多轮对话里收益很大。
和投资那条线的接口
单位经济是把技术指标翻译成财务语言的落点。它连接两边:
- 往技术这边:单位成本由带宽、并行效率、利用率决定。
- 往财务那边:单位成本乘以调用量,就是收入里对应的成本;它决定了毛利率,也决定了这么多资本开支最终能不能被消化。
所以当有人问「AI 资本开支是不是泡沫」时,真正可计算的那个变量,就是单位成本随规模下降的斜率,和需求增长的速度之间的关系。前者快,投资就划算;前者慢,就是无底洞。
要点回顾
- 单位成本 = (折旧 + 电力 + 运维)÷ 实际产出的 token 数。
- 固定成本占大头,所以利用率(分母)是最关键的变量。
- 前面九条讲的技术瓶颈最终都表现为:利用率上不去 → 单位成本下不来。
- 需求峰谷让实际利用率永远低于按峰值设计的容量,削峰填谷是重要手段。
- 单位经济是把技术指标翻译成财务语言的落点——它决定了资本开支最终能不能被消化。