学习 / AI 基础架构 / 08

AI 基础架构 · 第 08 条 · 设施

数据中心的电和水

算力的上限,最后往往不是芯片决定的,而是电和散热决定的。这是 AI 基础设施里最物理、也最容易被忽略的一层。

难度 入门 → 进阶约 11 分钟前置:1 条更新 2026-09-28

功率密度在快速上升

传统数据中心的单个机柜功率大约几到十几千瓦。而装了高密度 AI 加速器的机柜,功率可以达到几十千瓦甚至更高——因为一块高端 AI 芯片本身的功耗就有几百瓦,一个机柜能装八块甚至更多。

这个量级的变化,把很多传统做法直接推到了极限。

散热方式是被功率密度逼着换的传统机柜≈ 5–15 kW高密度 AI 机柜≈ 40–100 kW空气的比热容低、导热差 —— 超过临界点,风扇吹得再猛也没用所以高密度集群转向液冷:整栋楼的管路、消防、承重都要改,周期比买卡长得多而电力接入通常以「年」为单位排队——这才是算力扩张真正的硬约束
两条柱子差了将近一个数量级。空气的比热容和导热率决定了风冷的天花板——超过那个点,风扇再猛也没用,只能上液冷。而液冷要改的是一整栋楼(管路、消防、承重),这个改造周期往往比买卡长得多。

散热:从风冷到液冷

风冷的散热能力有物理上限——空气的比热容低、导热差。当功率密度超过某个临界点,风扇吹得再猛也没用。

所以高密度集群转向液冷:用液体直接带走热量,效率高得多。但液冷意味着整套机房设计要改——管路、密封、维护流程、故障处理,都不能沿用旧方案。

散热不只是技术问题,也是改造周期问题。把一栋楼从风冷改成液冷,涉及的不只是买设备,还有结构承重、管路铺设、消防方案。这些改造的时间,往往比买卡长得多。

电力:更硬的约束

一个大型 AI 集群的用电量,可以相当于一座中小城市的规模。而电力相关的事情都慢:

这就是为什么选址变成了战略问题——不只是选便宜的地方,而是选「有电、能接、能快速批」的地方。附带还会考虑气候(影响散热成本)、水资源(部分冷却方案耗水)、以及网络到用户的距离。

它如何影响成本

把这几层串起来看:芯片成本是一次性的(资本开支),而电力、散热、运维是持续性的(运营开支)。

一个集群跑得越满,单位产出分摊到的固定成本越低,但电费会等比例上升。所以「利用率」这个变量在成本里起的作用特别大——它决定了一次性投入被摊薄到什么程度。

这也是为什么数据中心常常建在电价低、气候凉的地方:这些条件直接影响的是长期运营成本,而运营成本是决定推理毛利的关键变量。

要点回顾
← 量化与蒸馏:把模型塞进更小的盒子 单位经济:一个 token 的真实成本 →