学习 / AI 基础架构 / 09

AI 基础架构 · 第 09 条 · 经济性

单位经济:一个 token 的真实成本

把所有技术约束翻译成钱。一个 token 的成本,是理解 AI 生意能不能赚钱的落点。

难度 入门 → 进阶约 13 分钟前置:2 条更新 2026-09-28

成本由三块构成

成本项性质主要驱动因素
折旧固定,一次性投入摊到年限硬件采购价、折旧年限
电力与散热随使用量变化功耗、电价、利用率
运维与人力半固定机房、网络、团队
单位成本 = (折旧 + 电力 + 运维)÷ 实际产出的 token 数
分子里固定成本占大头,所以分母(实际产出)才是关键变量。
一个 token 的成本怎么构成55%30%15%分子:固定成本占大头分母才是关键变量满负荷0.001 元/token跑一半0.002 元/token只跑四分之一0.004 元/token分子几乎不变,分母砍半 → 单位成本翻倍前面所有技术瓶颈——带宽、并行效率、批太小——最终都表现为「利用率上不去」,也就是钱花得不值
左边是成本的构成,右边是利用率对结果的影响。关键在右边:分子(折旧+电费+运维)几乎不变,分母(实际产出的 token)砍半,单位成本就翻倍。前面讲的所有技术瓶颈,最后都落在这个分母上。

利用率为什么这么关键

假设一块卡折旧加电费一年是 10 万块。如果它满负荷运转,一年产出 1 亿个 token,单位成本就是 0.001 元/token。如果只跑了一半,产出 5,000 万,单位成本就翻倍——分子几乎没变,分母砍半。

而这个「利用率」受前面所有技术环节的制约:带宽瓶颈会压低利用率、并行效率会压低利用率、批太小也会压低利用率。

所以前面九条讲的技术问题,最终都会在这里变成钱。

为什么推理的单位成本比训练更难算

训练成本相对好算:总的算力消耗除以一次训练的产出(一个模型)。一次性、可估算。

推理成本难在「需求波动」:用户请求有峰谷。为了应对峰值,必须准备足够的容量;但在谷时,这些容量闲置。于是实际利用率永远低于按峰值设计的容量。

几个能显著改善单位成本的杠杆

  1. 提高利用率:连续批处理、混合在线/离线负载、调度优化。
  2. 降低单次计算量:量化、蒸馏、更高效的模型结构。
  3. 降低硬件成本:更便宜的芯片、更长的折旧年限(但要合理)、更低的电价。
  4. 提高缓存命中:相同的输入前缀可以复用中间结果,这在多轮对话里收益很大。

和投资那条线的接口

单位经济是把技术指标翻译成财务语言的落点。它连接两边:

所以当有人问「AI 资本开支是不是泡沫」时,真正可计算的那个变量,就是单位成本随规模下降的斜率,和需求增长的速度之间的关系。前者快,投资就划算;前者慢,就是无底洞。

要点回顾
← 数据中心的电和水 回到学习总览 →