
10万卡超算集群的散热难题:浸没式液冷是怎么把温度压下去的
这两天科技圈最提气的一条新闻,莫过于国家超算互联网郑州核心节点迎来了首个全国产10万卡人工智能超集群。央视报道说,这个集群每秒钟的峰值计算能力,相当于全人类持续计算200年。数字听着挺玄乎,但作为一个整天跟服务器、算力打交道的开发者,我更关心的是它底下那些实打实的技术细节。
先说结论:这台集群能跑起来,靠的是两条腿——浸没式相变液冷,加上"超智融合"的架构思路。这两样东西,恰恰是这几年国内算力基建里最值得琢磨的方向。
液冷不是新鲜事,但相变液冷是另一回事
传统机房靠空调吹风降温,到了高密度部署阶段就顶不住了。单机柜功率密度一上来,风冷的热交换效率根本不够看。这次投用的曙光8000(登峰)用的是浸没式相变液冷,说白了就是把服务器整个泡进冷却液里,利用液体沸腾吸热、蒸汽冷凝放热的物理循环来带走热量。这套方案能支撑单机柜兆瓦级的功率密度,配合国产冷媒和全年自然冷却,PUE能压得很低。
对我们做运维的人来说,液冷带来的变化是实实在在的:机房不用再堆那么密的空调,噪音小一截,电费账单也好看不少。当然,浸没式液冷的坑也不少,比如冷却液的兼容性、服务器密封、维护时怎么把设备捞出来,这些都是一线工程师要头疼的事。但方向是对的——大模型训练那种动辄几千瓦的单卡功耗,风冷是真的压不住了。
"超智融合"到底融合了个啥
另一个关键词是"超智融合"。以前科学计算和智能计算是两条赛道:科学计算追求双精度(FP64),做气象模拟、材料仿真;AI训练用低精度(INT8、FP16),追求吞吐。传统超算和AI集群各干各的,互不搭理。
曙光8000的思路是把两者揉到一起,支持从FP64到INT8的全精度覆盖。好处显而易见:一套集群既能跑新材料、创新药的科研计算,又能做大模型训练和AI推理,不用重复建设。报道里说它现在支撑着26个领域300多种计算任务,就是这个架构带来的红利。对中小企业来说,这其实是个信号——以后想用超算级算力,未必非得自建,超算互联网上按需租就行。
国产化走到哪一步了
这个集群"全国产"三个字的分量,业内人都懂。从芯片到互联网络,再到整机系统,全部自主可控。过去国产算力总被诟病"单卡能打、集群拉胯",卡在互联带宽和软件栈上。这次10万卡规模能稳定跑起来,说明国产高速互联和集群调度这块确实补上了大课。
当然,也别急着吹。10万卡集群的运维复杂度是指数级上升的,故障定位、任务调度、通信优化,每一环都是硬骨头。集群投用只是开始,能不能把利用率跑上去,才是真正的考验。
作为一个长期关注算力基础设施的人,我的感受是:国产算力这几年是真的在闷头赶路,从"能用"到"好用",差距在肉眼可见地缩小。接下来值得期待的是,这套集群能跑出什么像样的科研成果,那才是最有说服力的答卷。
评论 (0)
暂无评论,来写第一条吧 ✍️