AI 基础架构 · 第 08 条 · 设施
数据中心的电和水
算力的上限,最后往往不是芯片决定的,而是电和散热决定的。这是 AI 基础设施里最物理、也最容易被忽略的一层。
功率密度在快速上升
传统数据中心的单个机柜功率大约几到十几千瓦。而装了高密度 AI 加速器的机柜,功率可以达到几十千瓦甚至更高——因为一块高端 AI 芯片本身的功耗就有几百瓦,一个机柜能装八块甚至更多。
这个量级的变化,把很多传统做法直接推到了极限。
散热:从风冷到液冷
风冷的散热能力有物理上限——空气的比热容低、导热差。当功率密度超过某个临界点,风扇吹得再猛也没用。
所以高密度集群转向液冷:用液体直接带走热量,效率高得多。但液冷意味着整套机房设计要改——管路、密封、维护流程、故障处理,都不能沿用旧方案。
散热不只是技术问题,也是改造周期问题。把一栋楼从风冷改成液冷,涉及的不只是买设备,还有结构承重、管路铺设、消防方案。这些改造的时间,往往比买卡长得多。
电力:更硬的约束
一个大型 AI 集群的用电量,可以相当于一座中小城市的规模。而电力相关的事情都慢:
- 接入容量:一个园区的电力接入要走申请、审批、建设流程,周期以年计。
- 供电稳定性:训练中断的代价极高,所以对供电可靠性的要求也比普通数据中心高。
- 电价结构:长期来看,电费会体现在推理的单位成本里。
这就是为什么选址变成了战略问题——不只是选便宜的地方,而是选「有电、能接、能快速批」的地方。附带还会考虑气候(影响散热成本)、水资源(部分冷却方案耗水)、以及网络到用户的距离。
它如何影响成本
把这几层串起来看:芯片成本是一次性的(资本开支),而电力、散热、运维是持续性的(运营开支)。
一个集群跑得越满,单位产出分摊到的固定成本越低,但电费会等比例上升。所以「利用率」这个变量在成本里起的作用特别大——它决定了一次性投入被摊薄到什么程度。
这也是为什么数据中心常常建在电价低、气候凉的地方:这些条件直接影响的是长期运营成本,而运营成本是决定推理毛利的关键变量。
要点回顾
- AI 机柜的功率密度是传统数据中心的数倍,把风冷推到了物理极限。
- 液冷是必然方向,但改造涉及结构、管路、消防,周期往往比买卡长。
- 电力接入以年计,可靠性和电价结构都影响总成本,选址因此变成战略问题。
- 芯片成本是一次性资本开支,电力散热运维是持续运营开支。
- 利用率决定一次性投入被摊薄的程度,是成本里的关键变量。