法不净空,觉无性也。

第一章:选址与能耗——不仅仅是算账

2025.12.24

一座宏伟大厦的崛起,始于一块坚实的基石。一个强大帝国的建立,源于一片丰饶的土地。同样,一个国家智算中心——这个数字时代的“超级工厂”和“决策中枢”——其成败与价值,在很大程度上取决于它在物理世界中的“落脚点”。

选址与能耗,这个看似属于项目前期筹备的技术性问题,在许多传统基建项目中,往往被简化为一道会计题:哪里的地价便宜?哪里的电价低?哪里的政策补贴多?用最短的路径、最低的成本,完成从规划到亮灯的流程,似乎就是项目负责人的最大功绩。

然而,对于智算中心而言,这种短视的、纯粹的“算账”思维,是极其危险且具有误导性的。因为它忽略了一个最基本、最朴素,却也最深刻的物理事实。这个事实,是理解智算中心一切能耗问题、乃至“东数西算”国家战略的逻辑起点。

这个事实就是:算力即热力。

1.1 算力即热力:智算中心的物理本质与国家棋局

我们常常被数字世界的虚拟性所迷惑。代码、数据、模型……这些概念轻盈、飘渺,仿佛存在于一个与我们物理世界平行的、没有质量和能量消耗的“云端”。我们谈论着“上云”,似乎数据真的像水蒸气一样,轻盈地飘向了天空。

这是一个美丽的误会。

数字世界的每一次运算,都必须在物理世界中留下痕迹。这个痕迹,就是热。

让我们剥开智算中心层层叠叠的机柜、线缆和软件,直视其最核心的单元——芯片。无论是CPU、GPU还是专用的ASIC芯片,其本质都是由数十亿、数百亿个微小的晶体管组成的超级开关。每一次计算,无论是简单的加法,还是复杂的矩阵乘法,都对应着这些晶体管以惊人速度进行的亿万次“开”与“关”的状态切换。根据物理学的基本定律,任何宏观不可逆的过程都会导致熵的增加,而在微观层面,每一次晶体管状态的改变,无论多么高效,都不可避免地伴随着能量的损耗。这些损耗的能量,最终几乎全部以热能的形式释放出来。

一个晶体管产生的热量微不足道,但当数万颗高性能芯片在一个封闭的空间里以接近100%的负载同时咆哮时,其产生的热量是惊人的。一台搭载8张顶级GPU的高性能服务器,其满载运行的功耗通常在10千瓦上下(计算示例:以单卡数百瓦至千瓦级的功耗量级估算),这大体相当于数十台家用空调的制热功率。而一个大型智算中心,动辄部署数千、数万台这样的服务器。

因此,我们必须建立一个全新的认知:国家智算中心,从物理本质上看,不是一个信息的“图书馆”,而是一个能量的“转换炉”。 它吸入巨大的电能,通过计算这一“冶炼”过程,将原始、混乱的数据(高信息熵)锻造成结构化、有序的知识和决策(低信息熵)。而在这个过程中,它必然会产生一个副产品——巨大的、必须被排出的热量(高热力学熵)。

1.1.1 “熵增”悖论:信息减熵与物理增熵的二元性

这里,我们遇到了智算中心的第一个核心悖论,也是理解本书内核的关键。

从信息论的角度看,智算中心是一个强大的“减熵器”。它对抗的是我们序言中所述的“信息过载之熵”、“决策复杂之熵”和“未来不测之熵”。它通过强大的收敛能力,为混乱的世界注入秩序和确定性。这是它的使命,也是它的价值所在。

但从热力学的角度看,智算中心却是一个不折不扣的“熵增”大户。它遵循热力学第二定律,将高质量的、有序的电能,转化为低质量的、无序的热能,并将其排放到环境中,从而增加了整个物理系统的总熵。

这个“信息减熵”与“物理增熵”的二元性,是所有智算中心管理者必须面对的根本矛盾。我们的任务,就是要以最小的“物理增熵”代价,换取最大的“信息减熵”收益。而解决这个矛盾的第一步,也是最关键的一步,就是选址。

选址,本质上是在回答一个问题:我们应该把这个巨大的“热源”和“电老虎”,安放在国土的什么位置,才能让它对物理环境的负面影响最小化,同时让它产生的正面信息价值最大化?

如果我们仅仅从“离市场近”的传统商业逻辑出发,将所有大型智算中心都堆砌在东部沿海的一线城市,那么我们将很快面临一场灾难。北京、上海、深圳等城市,人口稠密、寸土寸金、能源配额极度紧张。在这里建设一个10万台服务器规模的智算中心,无异于在市中心的王府井、南京路旁,再建一座首钢规模的炼钢厂。它不仅会带来难以承受的电网负荷,其散发的热量将加剧城市热岛效应,其冷却系统所需的大量水资源,也将与居民生活和工业生产争夺本已紧张的指标。

这种布局,会让智算中心的“物理增熵”效应被无限放大,其成本和负外部性将很快超过其“信息减熵”带来的收益。这是一种不可持续的发展模式。

正是在这样的背景下,“东数西算”这一具有远见卓识的国家战略应运而生。

1.1.2 “东数西算”:从IT布局到国家级的“热力学”解决方案

“东数西算”工程,如果仅仅从字面理解为“把东部的数据拿到西部去计算”,那就大大低估了其背后深刻的战略考量。它不是一个简单的IT资源异地部署方案,它是我们国家层面,针对智算中心“熵增悖论”提出的一个系统性的、基于热力学原理的解决方案。

它是一次对国家整体资源禀赋的重新审视和优化配置,其雄心和魄力,堪比数字时代的“南水北调”与“西气东输”。

  • “东数”——需求的源头,价值的出口

    东部地区,特别是京津冀、长三角、粤港澳大湾区,是我国经济最活跃、数字化程度最高的区域。这里聚集了最多的金融机构、互联网公司、高端制造业和科研院所。它们是数据的最大生产者,也是对算力需求最迫切的消费者。城市治理、金融交易、自动驾驶、工业互联网……这些应用场景,构成了“东数”的基本盘。

    同时,东部地区也是算力价值的最终实现地。算力产生的决策,要在这里落地;算力孵化的产业,要在这里生根。因此,东部需要的是算力的“接口”和“展示窗口”,而不是算力的“生产车间”。

  • “西算”——能源的基地,散热的沃土

    与之相对,我国西部地区,拥有建设大型、超大型智算中心的天然优势,这些优势恰恰完美地回应了智算中心的物理本质——“热源”和“电老虎”。

    1. 能源禀赋(解决“电老虎”问题):西部地区是国家能源的战略后方。新疆、内蒙古的风,青海、甘肃的光,四川、云南的水……这些地区拥有丰富且成本低廉的清洁能源。将智算中心建在这些“绿电”的源头,就如同把炼钢厂建在煤矿和铁矿旁边。这不仅大大降低了电力成本,更重要的是,它能就地消纳这些因远离负荷中心而常常被浪费的“弃风”、“弃光”、“弃水”,将不稳定的绿色能源,转化为稳定输出的、高附加值的算力服务。这本身就是一种国家层面的能源优化。
    2. 气候条件(解决“热源”问题):西部地区普遍海拔较高,气候冷凉干燥。例如,贵州年平均气温在15℃左右,内蒙古的乌兰察布被称为“草原云都”,夏季凉爽。这些气候条件,为智算中心提供了一个天然的“冷源”。利用自然风冷、间接蒸发冷却等技术,可以大幅减少用于制冷的能耗。在传统风冷数据中心,制冷系统的能耗通常占总能耗的20%-40%(视气候与技术路线而定,行业调查中常见约四成上下的口径),而在西部地区,借助自然条件,这一比例可以被显著压缩。这等于是在免费享用大自然的“空调”。
    3. 地理与资源:西部地区地广人稀,土地成本低廉,地质结构相对稳定,为建设大规模的数据中心集群提供了充足的空间。同时,水资源虽然在某些地区(如西北)稀缺,但在西南地区则相对充裕,这为后续我们探讨WUE(水资源效率)时,提供了不同的选择路径。

“东数西算”的本质,就是用一根根高速光纤,取代了特高压输电线路,进行了一次更高效率的“西电东送”。

过去,我们把西部的能源转化为电,通过特高压等远距离输电线路送到东部,途中存在一定比例的线损(典型量级在个位数百分比,随电压等级与输电距离而异)。而现在,我们把西部的电,在本地就地转化为算力,再通过传输损耗远低于输电线损的光纤网络,将“算力”这种更高阶的“数字能源”输送到东部。这是一次能源输送模式的代际升级。

1.1.3 管理者的棋盘:如何落子“东数西算”

作为地方政府的管理者或国企的负责人,理解了“东数西算”的热力学本质和国家战略意图后,我们的决策就不再是“要不要去西部建”,而是“应该在西部建什么,在东部留什么”。

这需要我们像一个棋手一样,对算力需求进行分类,并将其合理地布局在“东”和“西”这两个棋盘上。

“热数据”与“东部枢纽”

并非所有计算任务都适合放在遥远的西部。有一类业务,我们称之为“热数据”处理,它们对网络延迟极其敏感。

  • 金融高频交易:胜负在毫秒之间,任何额外的网络延迟都可能导致巨大的经济损失。
  • 自动驾驶的实时决策:车辆需要与路边的计算单元进行实时通信,以应对突发路况,业界通常要求车路协同链路的端到端延迟控制在10毫秒量级以内。
  • 远程手术、VR/AR交互:用户的实时体验直接取决于延迟,过高的延迟会带来眩晕感和操作失误。
  • 城市大脑的应急响应:如交通信号灯的实时调控,必须在本地瞬间完成。

对于这些“热数据”业务,我们应该在东部城市集群内部或周边,建设“边缘数据中心”或“区域性智算枢纽”。它们的规模不必追求最大,但必须追求极致的低延迟和高可靠性。它们是“东数西算”棋局中的“前哨站”和“桥头堡”,负责处理那些“等不及”的计算任务。

“冷/温数据”与“西部基地”

与“热数据”相对的,是大量的“冷/温数据”处理任务。这些任务对吞吐量要求高,但对实时性要求相对宽松。

  • 大规模人工智能模型训练:训练一个千亿参数的大模型,往往需要连续运行数周甚至数月。几十毫秒的网络延迟,对于整个训练周期来说,几乎可以忽略不计。
  • 影视动漫渲染:一部电影的后期渲染,同样是海量的计算任务,可以提前安排,分批次完成。
  • 科学计算与气象模拟:例如基因测序、宇宙模拟、长期气候预测等,这些都是典型的后台高吞吐量计算。
  • 数据备份与归档:这是典型的“冷数据”应用,对延迟完全不敏感。

这些“冷/温数据”业务,正是应该迁移到西部智算基地的核心负载。将这些“算力密集型”而非“延迟敏感型”的任务部署在西部,可以最大化地享受西部的低成本能源和自然冷却优势,实现经济效益和环境效益的双赢。

因此,一个成熟的国家智算中心布局,必然是一个“东西联动、冷热分离”的有机体系。东部如神经末梢,敏锐感知,快速反应;西部如大脑皮层,深度思考,集中处理。管理者需要做的,就是建立一套有效的算力调度机制,像一个聪明的交通指挥系统一样,将不同类型的计算任务,精准地分发到最适合它的计算节点上。

这盘棋下好了,我们就能真正把西部的风和光,源源不断地变成东部的GDP和创新力;把东部的海量数据,转化为驱动西部绿色发展的“新石油”。这不仅仅是算了一笔经济账,更是为国家能源安全、区域协调发展和数字经济的可持续性,下了一步决胜未来的先手棋。

1.2 PUE的陷阱:从单一指标到“绿色账”的系统思维

在智算中心的建设和运营讨论中,有一个词汇出现的频率之高,几乎成为了衡量其“绿色”与否的唯一图腾。这个词就是PUE。

PUE,全称Power Usage Effectiveness(电源使用效率),其计算公式非常简单:

PUE = 数据中心总耗电 / IT设备耗电

这个指标的理想值是1.0,意味着所有进入数据中心的电能,都百分之百地用在了服务器、存储、网络等IT设备上,没有任何一点浪费在制冷、供配电等辅助系统上。当然,这在现实中是不可能实现的。目前,全球先进的智算中心,PUE值通常在1.1到1.3之间。一个PUE为1.2的智算中心,意味着IT设备每消耗1度电,就需要额外消耗0.2度电用于制冷和供电。

PUE的出现,无疑是数据中心行业走向精细化、绿色化管理的一个重要里程碑。它提供了一个简单、直观的标尺,让管理者能够量化和比较不同数据中心的能源效率,并以此为目标进行技术改造和优化。在过去的十年里,对PUE的极致追求,催生了液冷、间接蒸发冷却、高压直流供电等一系列节能技术的创新和应用。

然而,当一个指标被推上神坛,成为唯一的、压倒一切的考核标准时,危险的“陷阱”也就随之而来。

对PUE的盲目崇拜和机械执行,正在让我们陷入一种“指标异化”的困境。 我们可能赢得了漂亮的PUE数字,却输掉了更宏观、更根本的“绿色账”。作为国家智算中心的操盘手,我们必须具备超越PUE的系统性思维,学会算好一本涵盖水、电、碳的全方位“绿色大账”。

1.2.1 PUE的第一个陷阱:忽视了电的“出身”

PUE公式最大的盲点在于,它只关心“进入数据中心的电”是如何被分配的,却完全不问这些电是“从哪里来的”。

在PUE的计算器里,一度来自燃煤火电厂的“黑电”,和一度来自风力发电机或光伏板的“绿电”,是完全等价的。

这就导致了一个荒谬的局面:

一个建在东部大城市、PUE低至1.15,但其所用电力100%来自市政电网(主要由燃煤火电构成)的智算中心,在报表上看起来可能比一个建在西部戈壁、PUE为1.25,但其80%电力直接来自旁边风光电场的智算中心,要“更绿色”、“更先进”。

这显然是违背常识的。前者虽然内部能源效率稍高,但它消耗的每一度电,都在为大气贡献着实实在在的二氧化碳;而后者,尽管内部的制冷和供电系统效率略逊一筹,但其能源的“底色”是清洁的,它对整个环境的碳足迹要小得多。

管理者的第一个思维升级,就是要从“PUE至上”转向“绿电优先”。

在项目选址和规划阶段,我们就应该将“可再生能源可及性”作为与土地、网络并列的核心考量因素。我们应该优先选择那些靠近大型风电、光伏、水电基地的地点,甚至探索“源网荷储一体化”的新模式,将智算中心与新能源电站打包建设,实现“前店后厂”式的绿电直供。

这样做的好处是多方面的:

  • 环境效益:从源头上降低了智算中心的碳排放,真正践行了“双碳”目标。
  • 经济效益:通过与新能源企业签订长期购电协议,可以锁定未来10年甚至20年的低廉电价,规避化石能源价格波动的风险。
  • 社会效益:帮助西部地区消纳不稳定的新能源,将“垃圾电”转化为高价值的算力服务,支持了国家能源结构的转型。

因此,在我们的考核体系中,必须引入一个新的指标,我们称之为“绿电渗透率”,即智算中心全年消耗的绿电总量占总用电量的比例。一个真正绿色的智算中心,应该是高绿电渗透率与低PUE的结合体。一个绿电占比超过80%但PUE为1.3的中心,其对国家“双碳”战略的贡献,要远远大于一个绿电占比为零但PUE为1.1的中心。

1.2.2 PUE的第二个陷阱:隐藏了水的代价

为了追求极致的低PUE,许多数据中心采用了蒸发冷却技术。其原理很简单,就是利用水蒸发时会吸收大量热量的物理特性,来为服务器降温。这种技术,特别是在干燥地区,其制冷效率远高于传统的风冷空调,能够非常有效地降低PUE数值。

然而,PUE的计算公式中,分母和分子都是“电”,它完全没有体现“水”的消耗。

这就带来了第二个陷阱:我们可能用大量的、宝贵的水资源,换来了一个漂亮的PUE数字。

在水资源相对充沛的地区,这或许不是一个大问题。但在我国“胡焕庸线”以西的许多地区,水资源是比电和土地更为稀缺、更为宝贵的战略资源。在这些地方,盲目上马以消耗水为代价的制冷方案,无异于“饮鸩止渴”。一个采用蒸发冷却的大型数据中心,全年耗水量可达百万立方米量级(量级示例,随规模与制冷方案差异很大),相当于数万个家庭一年的用水量。在一个本就干旱缺水的地区,这无疑会加剧当地的生态压力和工农业用水矛盾。

为了走出这个陷阱,我们必须引入第二个关键指标:WUE(Water Usage Effectiveness,水资源使用效率)。

WUE的定义有多种,一个常用的计算方法是:

WUE = 数据中心年总耗水量(升) / IT设备年总耗电量(千瓦时)

这个指标的单位是“升/千瓦时”,它衡量的是IT设备每消耗一度电,需要蒸发或消耗多少升的水。显然,WUE的数值越低越好。一个WUE为0的数据中心,意味着它是一个“零耗水”的数据中心。

管理者的第二个思维升级,就是要建立“水-电”双控的平衡观。

在进行技术选型时,我们不能只问“这个方案PUE能做到多少?”,还要追问“它的WUE是多少?”。我们需要像关注电价一样,关注当地的水价、水资源配额以及取水的环境影响评估。

这要求我们因地制宜,采取差异化的技术路线:

  • 在水资源丰富的西南地区(如贵州、四川):可以适度采用高效的蒸发冷却技术,以水换电,追求极致的PUE。但同时也要考虑水源地的生态承载力,避免对局部水环境造成破坏。
  • 在极度干旱的西北地区(如新疆、甘肃、内蒙古):必须严格限制或禁止使用蒸发冷却方案。即使这意味着PUE会相对高一些,也必须优先保障水资源安全。在这些地区,应该大力推广闭式冷却系统(如采用冷冻水和冷却塔,水在系统中循环使用,仅有少量蒸发损失)和先进的液冷技术。特别是液冷,通过将冷却液直接与芯片接触,其散热效率远高于空气,可以大幅降低对风机和空调的依赖,从而在不耗水的情况下,也能实现极低的PUE。
  • 探索“水-热”联用:更进一步的系统思维,是考虑如何将智算中心排出的“废水”(经过处理的冷却水)和“废热”进行资源化利用。例如,将温热的冷却水用于周边的农业温室大棚灌溉和供暖,或者接入城市供热管网,为居民区提供冬季采暖。这种“算力-农业”、“算力-民生”的耦合模式,将智算中心从一个单纯的能源消耗者,转变为区域能源循环体系中的一个积极参与者。

引入WUE指标,本质上是要求我们将智算中心的环境影响评估,从单一的“能源”维度,扩展到“能源-水资源”的二维平面。一个真正对环境负责的智算中心,必须是在这个二维平面上找到一个最优的平衡点,而不是在单一维度上追求极限。

1.2.3 PUE的第三个陷阱:掩盖了碳的全貌

即使我们同时考虑了PUE(电的效率)和绿电渗透率(电的来源),并且用WUE(水的消耗)对其进行了补充,我们距离算清一本完整的“绿色账”,仍然还差最后,也是最关键的一步。

这一步,是要回答一个终极问题:我们建设和运营这个智算中心,从摇篮到坟墓,总共向地球排放了多少温室气体?

这就是CUE(Carbon Usage Effectiveness,碳使用效率)的概念。

CUE的计算公式是:

CUE = 数据中心总碳排放量(千克CO2当量) / IT设备总耗电量(千瓦时)

这个指标的单位是“千克CO2当量/千瓦时”,它衡量的是IT设备每消耗一度电,所对应的总碳排放是多少。CUE的数值,同样是越低越好。

PUE的第三个陷阱,就在于它是一个“过程指标”,而不是一个“结果指标”。它只衡量了运营阶段的能源效率,却完全忽略了其他环节产生的巨大“隐含碳”。

一个完整的智算中心碳足迹(即CUE公式中的分子),至少应该包括三个部分,这在碳核算体系中被称为“范围一、范围二、范围三”:

范围一:直接排放

这部分主要指数据中心内部直接燃烧化石燃料产生的排放,最常见的就是备用柴油发电机。虽然它们不常启用,但在全生命周期内的测试和应急使用,也会产生碳排放。

范围二:间接排放(电力)

这是碳排放的大头,即我们前面讨论的,因消耗外购电力而产生的碳排放。这部分的计算与绿电渗透率直接相关。消耗的“黑电”越多,这部分的碳排放就越高。一个PUE很低但完全使用火电的中心,其范围二的碳排放将是惊人的。

范围三:间接排放(供应链与建筑)

这是最容易被忽视,也最难核算,但体量可能极其庞大的部分。它包括:

  • 上游供应链的碳排放:生产服务器、芯片、交换机、光模块、水泥、钢材等所有物料,在其各自的工厂里所产生的碳排放。一块高性能GPU的制造过程,本身就是高耗能、高碳排的。
  • 建设阶段的碳排放:土建施工、设备运输、安装调试过程中产生的碳排放。
  • 下游废弃物处理的碳排放:服务器等电子设备达到使用年限后,其回收、拆解、处理过程也会产生碳排放。

管理者的第三个思维升级,就是要建立“全生命周期”的碳核算意识。

我们不能只盯着运营报表上那个漂亮的PUE数字沾沾自喜,而对建设过程中消耗的大量钢筋水泥、以及机房里成千上万台服务器背后隐藏的“制造碳”视而不见。

建立这种系统思维,将深刻地改变我们的决策模式:

  1. 在设备采购上:我们不仅要看服务器的性能和价格,还要向供应商索取其产品的“碳足迹报告”。在性能相近的情况下,优先选择那些在生产制造过程中碳排放更低、使用了更多回收材料的“绿色服务器”。这将通过我们的采购行为,向上游供应链传递绿色压力,推动整个IT产业链的低碳转型。
  2. 在建筑设计上:推广使用绿色建材、预制化模块化建设,减少施工现场的浪费和排放。设计更长的建筑使用寿命,避免频繁的推倒重建。
  3. 在资产管理上:延长服务器的使用周期。过去,行业习惯于3-5年就淘汰一批服务器。但如果我们能通过软件优化和维护,将其使用寿命延长到6年、7年,就等于摊薄了其巨大的“制造碳”,这是对环境的巨大贡献。同时,建立完善的电子废弃物回收和再利用体系。
  4. 在最终考核上:将CUE作为衡量智算中心绿色水平的“终极指标”。PUE、WUE、绿电渗透率,这些都是过程中的优化参数,它们最终都应该服务于降低CUE这个总目标。一个地方政府,如果能率先建立起基于CUE的智算中心绿色评估标准,那它就在全国的数字经济绿色发展中,抢占了标准制定的话语权。

结论:从“算小账”到“算大账”

本章的讨论,从“算力即热力”这一物理本质出发,层层递进,为各位管理者揭示了传统选址与能耗评估模式的局限性。

  • 算经济小账:只看地价、电价。这是一种短视的、机会主义的思维,会让我们陷入“环首都、环上海”布局的陷阱,最终导致不可持续。
  • 算国家大账:理解“东数西算”的战略内涵,将其视为一次国家级的能源与算力资源优化配置。这要求我们具备全局观,懂得“冷热分离”,合理布局。
  • 算PUE的“效率账”:这是精细化管理的进步,但容易陷入“指标异化”的陷阱。
  • 算PUE+绿电渗透率+WUE+CUE的“绿色大账”:这是一种系统性的、全生命周期的可持续发展思维。它要求我们将电、水、碳、供应链、建筑等所有要素纳入一个统一的框架下进行综合考量。

作为新时代的基建操盘手,我们的责任,绝不仅仅是建起一座座能跑分、能赚钱的数据中心。我们的历史使命,是要为国家打造一个真正“环境友好、资源节约、自主可控”的数字底座。

这个底座,必须深深地扎根于我们国家的地理版图和资源禀富之中,它要能将西部的风光转化为东部的智慧,要能在提供澎湃算力的同时,守护好我们的绿水青山。

擦亮“观察之眼”的第一步,就是用这样一种更宏大、更系统、更负责任的视角,去审视我们脚下的这片土地,为我们的“收敛引擎”,找到那个最坚实、最绿色、也最智慧的安放之处。这不仅仅是算账,这是在为未来布局,是在为文明奠基。