
长期以来,传统通用服务器机柜功率密度偏低,行业普遍依靠芯片散热器、机房风扇搭配空调、冷热通道完成散热。在这套空气冷却体系下,通过增大风量、扩充换热面积便能满足运维需求,液冷技术仅小规模应用于超算、少数高性能计算场景,属于可选方案。
机架级AI计算彻底改变了这一逻辑。GPU之间需要通过NVLink或高速网络保持低时延、高带宽互联,服务器不能依靠拉大物理距离降低热密度;同时,CPU、交换芯片、网卡、DPU、内存和电源系统功耗同步提高。机柜由服务器的物理容器转变为统一供电、统一互联、统一冷却的计算系统,散热设计也相应升级为机架液冷网络。随着芯片功率和机柜密度提升,继续增加风量会带来风机功耗、噪声、机柜压差、气流短路和机房空间占用快速增加。在高密度AI场景中,液冷和高压供电逐步成为避免设备过热和保障系统运行的必要条件,液体能够以更小流量承载更多热量,冷板又可以直接接近芯片热源,显著缩短传热路径。
NVIDIA Vera Rubin NVL72机柜,正是算力基础设施变革的标志性产品。单机架集成72颗Rubin GPU、36颗Vera CPU,搭配18组计算托盘与9组NVLink交换托盘。不同于传统服务器模块化设计思路,Rubin平台在机柜研发初期,就要同步敲定冷板、集水器、快速接头、母排、控制系统以及数据中心CDU整体方案。液冷正式打通服务器物料清单(BOM)与数据中心基础设施,成为二者之间不可或缺的核心连接层。

NVL72机柜含18个计算托盘、9个交换托盘
风冷上限持续被高密度算力突破,液冷行业由此形成三重刚性需求。
其一为热流密度刚性需求。空气导热与储热能力存在天然瓶颈,芯片、机柜功耗持续走高后,单纯强化风冷系统成本与工程难度陡增。冷板直接贴合发热芯片,高效承接局部超高热流密度,解决风冷难以攻克的散热痛点。
其二是电力资源刚性需求。AI数据中心核心稀缺资源正在转变为电力容量。制冷系统每节省1MW能耗,就能分配更多电力供给算力芯片。NVIDIA主推45℃温水液冷搭配动态Max-Q功率管理方案,把制冷环节损耗的电力转移至GPU算力调度,最终实现更多Token输出,最大化算力利用效率。
其三是交付刚性需求。高密度液冷机柜出厂前,必须完成冷板、管路、连接件全套测试;进场后还需和CDU、一次侧供水系统、管控平台联调。渗漏、流量失衡、水质不达标等任一问题,都会造成整机柜停机。伴随单柜价值提升、算力集群持续扩容,下游客户对液冷供应商量产一致性、长期运行可靠性提出前所未有的高标准。
综上,AI算力集群的高密度、高功耗、高效率发展趋势,彻底颠覆了传统数据中心风冷散热体系,液冷技术已然从过去的小众备选方案,升级为AI算力基础设施建设的核心刚需。热流承载、电力节能、稳定交付的三重核心优势,让液冷成为突破算力散热瓶颈、盘活电力资源、保障算力集群稳定高效运行的关键支撑。未来,随着AI模型迭代、算力规模持续扩张,液冷技术将进一步向标准化、集成化、智能化方向演进,持续赋能算力基础设施的升级革新与低碳高效发展。
参考来源:
NVIDIA,东吴证券研究
东吴证券《液冷:下一代AIDC基础设施,Rubin带来行业确定性》