曙光数创:AI开始“拼电费”,液冷正重算工业算力经济账

商学院杂志
2026-09-10 13:44

来源:商学院杂志

液冷表面上解决的是服务器散热问题,背后解决的,却是工业AI能否稳定、持续、低成本运行的问题。

文|胡嘉琦

ID | BMR2004

2011年,液冷还不是AI基础设施的热门话题,彼时中科曙光旗下曙光数创已经开始布局这一领域。15年后,AI算力进入规模化扩张阶段,高功率GPU和AI加速器不断推高服务器功耗,传统风冷面临的功率密度、制冷效率和机房空间等约束越来越明显。液冷由此从一项相对“幕后”的基础设施技术,走到了AI算力产业链的前台。

而曙光数创,也在AI时代的洪流中脱颖而出,成为液冷领域的绝对龙头,连续5年稳坐行业头把交椅。

在曙光数创资深技术专家黄元峰看来,液冷表面上解决的是服务器散热问题,背后解决的却是工业AI能否稳定、持续、低成本运行的问题。

近日,围绕液冷如何支撑工业算力落地,黄元峰接受了《商学院》记者的采访。他告诉记者,“电力和散热并不是算法之外的附属问题,而是决定AI能否规模化落地的基础条件。”

的确,随着AI从数据中心走向生产环节,机器视觉、设备监测、数字孪生、工艺优化等工业AI应用开始持续消耗算力。与互联网应用相比,工业场景中的算力往往需要长期、稳定运行,并随着产线和设备节点增加不断扩张。电力、散热、机房空间以及长期运营成本,也因此逐渐进入工业企业的生产账本。

01

AI“发高烧”:液冷走到产业前台

工业AI的竞争不再只看算力总量,而要同时考察成本、稳定性和扩展能力。供电、散热、运维和算力效率与计算设备本身的关系越来越紧密,液冷也从一项“配套技术”变成算力基础设施竞争的一部分。

当一个AI项目从一条产线扩展到数十条产线、从几个设备节点扩展到数百个节点,企业需要考虑的就不只是GPU数量,还包括这些GPU需要多少电、占用多少空间,以及能否在7×24小时运行中保持稳定性能。

算力需求扩大的同时,AI芯片的功耗和热量也在同步上升。传统风冷主要依靠空气带走服务器产生的热量。当AI服务器功率密度提高,机房就需要更大的风量、更低的送风温度和更复杂的气流组织,风冷在功率密度、制冷效率和空间利用上的压力随之加大。

因此,企业不仅要为GPU和服务器付费,还要为这些设备产生的热量付费。正可谓算力越多,功耗越高;功耗越高,散热压力越大;散热压力越大,维持算力运行的成本也越高。

因此,工业AI的竞争不再只看算力总量,而要同时考察成本、稳定性和扩展能力。供电、散热、运维和算力效率与计算设备本身的关系越来越紧密,液冷也从一项“配套技术”变成算力基础设施竞争的一部分。

随着AI算力增强,散热正成为限制算力继续增长的瓶颈之一。根据中国电子技术标准化研究院、中关村协众创智信息产业促进会、ICT research联合编写的《中国算力基础设施液冷技术发展现状分析》,曙光数创2024年在中国算力中心基础设施液冷温控设备市场的出货量占比达到55.7%,市占率连续4年位居国内第一。

曙光数创的产品化进程也在加快。2015年,公司推出冷板式液冷产品并实现量产;2019年,全浸式液体相变冷却技术实现商业化落地;2025年,公司实现营业收入8.82亿元,同比增长74.29%。

市场快速增长,并不意味着竞争问题已经解决。对曙光数创而言,下一步不只是判断“液冷有没有市场”,而是要把10余年的技术积累转化为规模化交付、标准化产品和更强的产业竞争力。要回答这个问题,首先要看液冷究竟改变了怎样一笔算力经济账。

02

AI开始“拼电费”,液冷改变的是算力经济学

衡量AI基础设施,不能只看购买了多少卡,更要看算力利用率、单位任务成本和业务产出。

2011年,曙光数创布局液冷是一项技术选择,今天AI带来的需求增长,让这项技术进入规模化应用阶段。

随着AI芯片性能不断提升,功耗和热量同步上升。传统风冷主要通过空气把服务器产生的热量带走,随着AI服务器功率密度提高,风冷需要更大的风量、更低的送风温度以及更加复杂的气流组织。

这意味着,企业不仅要为GPU和服务器付费,还要为这些设备产生的热量付费。

尤其是在工业AI场景中,这笔成本会随着生产过程持续发生。“工业AI需要长期处理设备数据、工艺数据和视觉数据,很多推理任务需要7×24小时运行,算力成本不是一次性投入,而是持续发生的经营成本。”黄元峰表示。

因此,问题并不只是简单增加多少GPU,更是如何让这些GPU以企业可以承受的成本长期运行。

在黄元峰看来,液冷至少改变三方面效率。

第一是能源效率。液冷可以将冷量更直接地送达主要发热部件,减少传统风冷在空气输送以及部分制冷环节中的能量损耗。以曙光相变浸没液冷技术为基础的数据中心,PUE值可低至1.04。

第二是计算效率。“散热能力不足会导致芯片降频,名义算力并不等于持续可用算力。”黄元峰说。

第三是资源效率。即使企业拥有大量GPU,如果算力利用率不足、任务调度不合理,或者模型与硬件之间缺乏匹配,也可能出现计算资源闲置。

“衡量AI基础设施,不能只看购买了多少卡,更要看算力利用率、单位任务成本和业务产出。”黄元峰说。

从这个角度看,液冷改变的不是服务器的温度,而是企业核算AI基础设施投资回报的方式。

服务器采购只是初始投入,此后的电费、制冷、运维、空间、升级改造和设备折旧,都属于AI的长期成本。黄元峰认为,企业最大的误区之一,是“把AI基础设施理解成一次性的硬件采购,而不是一项需要长期运营的生产系统”。

“因此,企业真正需要比较的不是风冷设备和液冷设备的初始采购价格,而是整个生命周期内,每单位有效算力的综合成本。”黄元峰说。

而企业真正需要管理的,也不再只是“算力总量”,而是有效算力生产率。

03

押注系统能力

液冷与工业AI的关系并不是简单的“散热技术进入工厂”。当AI成为生产系统的一部分之后,算力基础设施本身就开始进入生产效率的计算公式。

当有效算力生产率成为衡量AI基础设施价值的重要指标时,液冷的价值需要放在整个系统中重新衡量。

一套AI基础设施能否真正提高生产效率,取决于芯片、服务器、存储、网络、制冷、电力和运维等多个环节能否协同。这也是中科曙光区别于单一液冷设备厂商的地方:其差异不只在于拥有液冷技术,还在于长期积累的计算基础设施能力。

从高性能计算机、服务器、存储,到云计算、算力服务和数据中心基础设施,母公司中科曙光正在形成从计算设备到基础设施和算力服务的业务链条。在这一体系中,曙光数创负责高效冷却和数据中心基础设施解决方案这一环节。

如今,这种系统能力已经开始在具体产业场景中落地。

以中国石化人工智能基础设施项目为例,2025年,曙光数创为中国石化提供冷板液冷解决方案,服务其勘探开发、炼油化工等9大核心业务。通过液冷技术提升机柜功率密度并降低数据中心能耗,该项目将PUE降至1.15,单机柜功率密度提升3倍以上,由此支撑大规模AI算力部署。这些算力最终服务于工业生产、油气勘探中的智能图像识别、炼化生产流程优化、无人仓储以及安全预警等业务。

可见,液冷虽然位于算力基础设施的底层,却连接着企业的具体生产需求。在黄元峰看来,PUE下降只是最直观的结果,更深层的价值是提升企业数字基础设施的承载能力和运营确定性。

首先,液冷能够支撑更高功率密度。在机房空间和供电条件有限的情况下,企业可以部署更多计算资源,减少大规模扩建机房的压力。

其次,稳定的温度环境有利于保障设备持续运行,降低芯片因温度波动而降频的概率。对于生产安全、设备监测、勘探开发等连续性要求较高的场景,系统稳定性本身就会影响生产效率。

最后,液冷推动数据中心从分散运维走向精细化运营。温度、压力、流量、能耗等指标可以被持续监测和统一管理,企业因而能够更准确地掌握资源利用、能源消耗和单项AI任务成本。

“因此,液冷带来的不只是节电,而是使企业有条件把更多AI应用从试点推向常态化生产。”黄元峰说。

中国石化的案例也说明,液冷与工业AI的关系并不是简单的“散热技术进入工厂”。当AI成为生产系统的一部分之后,算力基础设施本身就开始进入生产效率的计算公式。

另一方面,工业场景具有连续运行、环境复杂等特点。与标准化数据中心相比,工厂现场面临灰尘、温度、噪声、空间以及供电条件等更多约束。提高单位空间的算力密度、降低制冷系统的能耗和复杂度,不仅关系到数据中心效率,也关系到工业AI能否持续扩张。

随着模块化、集装箱式等部署方式的发展,算力基础设施也有望进一步向生产现场延伸。

从这个意义上看,液冷不再只是大型数据中心的基础设施,还可能成为工业AI走向规模化生产的重要底座。

与此同时,曙光数创也面临新的挑战。2025年,公司收入增长74.29%,但归母净利润却下降39.93%,毛利率也有所下降。

这意味着,液冷产业由技术竞争走向规模竞争时,研发投入、客户验证、项目交付和长期运维,均会带来成本压力。技术优势能否转化为利润和规模,成为企业必须回答的问题。

因此,未来企业真正需要建立的竞争壁垒,并不是某一个液冷产品的参数,而是从技术研发、产品制造,到系统集成、项目交付和长期运维的完整能力。

04

下一轮AI竞争,可能发生在芯片之外

谁能以更低的成本、更高的稳定性,让算力持续服务于生产,谁才可能在工业AI的下一阶段竞争中占据优势。

从芯片到服务器,再到数据中心、供电和散热,AI竞争正在不断向基础设施底层延伸。芯片性能越强,对基础设施的要求越高;未来芯片功耗、机柜密度和集群规模仍可能继续提升。

“谁能够稳定带走热量,谁就能够支持更高密度的计算;谁能够以更低能耗完成这一过程,谁就拥有更低的算力成本。”黄元峰说。

黄元峰表示,未来3—5年,曙光数创计划围绕三个方向推进:

第一,完善工业算力基础设施。持续推进冷板式、相变间接式和相变浸没式液冷产品体系,加强计算、存储、网络、供配电和散热系统的协同设计,降低工业AI的全生命周期成本。

第二,推动算力与工业场景融合。围绕能源、制造、电力等行业,加强从基础设施、算力平台到行业应用的适配,使AI进入生产流程,并在质量检测、设备运维、工艺优化、能源管理和安全生产等环节形成可量化价值。

第三,完善自主可控、开放兼容的产业生态。推动关键技术、核心部件和工程体系自主化,同时通过标准建设和生态合作,降低不同芯片、服务器、模型和液冷系统之间的适配门槛。

对于曙光数创而言,下一阶段的竞争已不再只是“能不能做液冷”,而在于全栈协同、规模交付、标准兼容和长期可靠运行。

“国产液冷方案承担的不只是节能角色,还关系到算力基础设施的工程自主权和长期运营安全。”黄元峰表示。

一方面,国产液冷需要与国产处理器、服务器和整机系统协同设计,提高适配效率;另一方面,也需要形成覆盖研发、制造、测试、交付和运维的本地化保障体系。

但自主可控并不意味着封闭。未来大型企业可能同时使用不同芯片、服务器和计算平台。如果液冷系统缺乏标准化接口,反而可能形成新的适配壁垒,因此开放兼容也成为国产液冷走向规模化的重要条件。

黄元峰表示,曙光数创希望通过降低能耗和成本、提高可靠性,推动算力在工业场景中的应用。

当AI从一次技术试验变成一种长期生产能力,“谁拥有更多算力”或许已不再是唯一的问题。谁能以更低的成本、更高的稳定性,让算力持续服务于生产,谁才可能在工业AI的下一阶段竞争中占据优势。

来源|《商学院》杂志9月刊

(来源:商学院杂志 编辑:张明艳)