WayCloud 维云

逛完WAIC2026,发现大家都在拼“超节点”

行业趋势2026年7月20日维云信息科技阅读 487赞·转 31

WAIC2026 世界人工智能大会超节点展区

这是维云第 N 年参加 WAIC 世界人工智能大会。

展馆有多大、人有多挤,我就不多说了。

今年逛下来,我最大的感受只有一个:

几乎所有算力厂商,都在讲同一个词——超节点。

前两年,大家讨论最多的是大模型、具身智能;而今年,这个新词几乎出现在了每一家算力厂商的展台上。

什么是超节点?

简单来说,就是把几十张、上百张,甚至上千张算力卡,通过高速互联,"拧"成一台超级计算机,让它们像一颗芯片一样协同工作。

过去,大家比的是:"我的 GPU 有多强。"

现在,比的是:"我的一整柜 GPU,能不能真正协同工作。"

为什么风向变了?

因为答案已经很清楚了:大模型越做越大,参数动辄十万亿级别,单卡、单机根本喂不饱,卡与卡之间的通信效率,反而成了新的瓶颈。

于是,"超节点",成了今年WAIC最拥挤的赛道。

我们一路逛下来,把几家有代表性的公司,记录给你。

华为昇腾:把机柜做成一台计算机

华为展台依旧是全场最热门的区域之一,现场几乎围了三层观众。

今年首次公开亮相的是 昇腾 Atlas 950 SuperPoD。

单机柜集成 1,024 张昇腾 950 算力卡。

这是什么概念?相当于把过去一整个机房的算力,压进了一个柜子里。

更关键的是"统一算力池"——柜子里的1024张卡,不是简单堆在一起,而是共享同一个算力池,横向还能扩展到 8192卡。

华为给出的远期规划,是集群上限50万卡。

性能上,FP8算力1 EFLOPS,FP4算力2 EFLOPS,专门为十万亿参数级别的MoE大模型训练而生。

一位现场的工程师告诉我们,这不是纸面数字。华为上一代 384 卡的 SuperPoD,已经规模化商用 750 多套。

而这一次的 950 新一代,目标很明确:面向头部互联网公司的万卡集群建设。

换句话说,上一代已经在真实业务里跑了一年多,这一代,是奔着更大规模去的。

关键信息:

单机柜 1,024 卡

可扩展至 8,192 卡

远期规划 50 万卡集群

面向超大模型训练

阿里云:把超节点做成"标准件",开放给所有人

如果说华为在秀"能力上限",那阿里云在展台上讲的,是另一件事:怎么让超节点变得人人可用。

现场展示的灵骏真武 M890,被称为国内首个面向公有云开放的标准化超节点算力单元。

"标准化"三个字,是关键。它把规格定死在 64 卡一套,配上自研的 ICN Switch 1.0 互联芯片,单柜卡间带宽做到 800GB/s。

支持 FP8/FP4 低精度计算,一套实例,就能承载十万亿参数级别的MoE模型推理。

现场的同学解释说,这背后的逻辑,其实和公有云做ECS 服务器很像:以前,企业想用顶级算力,得自己攒集群、调网络、做运维,门槛很高。

现在,阿里云把"超节点"做成了一个标准化产品,直接开放邀测,乌兰察布算力基地已经在排队接入。

这意味着,超节点正在从少数头部企业的专属能力,逐步走向公共算力服务。

关键信息:

标准化超节点

公有云开放

64 卡标准单元

自研互联芯片

新华三:从 32 卡到 1,024 卡,把弹性做到极致

紫光股份旗下新华三集团展台摆放着不同规格的超节点机柜。从 32 卡、64 卡,到 256 卡、1,024 卡,一字排开。

这是他们的 UniPoD S80000系列,支持 32/64/256/1024 卡全档位,弹性扩容最高可以到 16384 卡集群。

单机柜最高64卡,配的是 120KW 的高密度液冷整机柜——这个功率密度,已经不是普通机房能直接承接的了,得配套专门的液冷改造。

现场的人告诉我们,32 卡和 64 卡的机型,已经进入了头部互联网公司的 POC 测试和小批量订单,下半年,交付量会持续释放。

比起前两家在"极限规模"或者"标准化开放"上做文章,新华三更像是在把"弹性"这件事做到极致——不管你的业务是从 32 卡起步,还是一步到位上千卡,都能在同一套产品体系里找到匹配的档位。

关键信息:

32 / 64 / 256 / 1,024 卡全档位覆盖

最大支持 16,384 卡扩展

高密度液冷

已进入 POC 及小批量交付

一整排"超节点",几乎挤满了半个展馆

除了这三家,我们在展馆里还看到一长串名字,几乎每走几步,就能碰到一家在讲"超节点":

锐捷的 ETH128,曙光的"登峰",中兴的 OEX 正交无背板开放超节点,燧原的云燧 ESL64-O,壁仞的全系列超节点,沐曦的高密度超节点,还有百度的天池 256 卡超节点。

这些公司里,有传统的网络设备厂商,有算力芯片新势力,也有云厂商自己下场。

他们的技术路线不完全一样,有的主打无背板正交架构,有的主打液冷密度,有的主打互联协议自研。但拆开来看,做的其实是同一件事:

把"卡"这个基本单元,重新组织成一个更大、更高效的计算整体。

这背后,其实藏着一条很朴素的逻辑:单卡的算力提升,正在变得越来越贵、越来越难。

台积电的先进制程一代比一代难啃,一张卡想再快一倍,成本可能要翻好几倍。

但如果换个思路——把互联做好,让 1024 张卡像一张卡一样协同工作,整体效率的提升空间,反而比死磕单卡更大、更划算。

于是,"超节点"就成了今年所有算力厂商的共同答案。

超节点热闹的背后,是一场关于"运维"的新考题

逛到最后,我们几个同事聊起一个问题:这么多超节点冒出来,谁来保证它们稳定跑起来?

这不是个空洞的问题。

1024 张卡挤在一个机柜里,任何一张卡出问题、任何一处液冷管路松动,影响的可能不是一张卡的算力,而是整个统一算力池的效率。

规模越大,容错的难度反而越高。

这也是为什么,我们在展馆里,除了看算力厂商,也特别留意了那些做运维、做巡检、做备件保障的公司。

超节点解决了"算力怎么堆起来"的问题,但"算力怎么稳定跑下去",才是下一道真正的考题。

而这道考题,恰恰是最容易被聚光灯忽略、却最考验真功夫的地方。

大公司在展台上,展示的是超节点能跑多快、能扩多大。

但真正决定这些万卡集群能不能持续产出价值的,往往是那些藏在机房里,做日常巡检、故障响应、备件调度的团队。

超节点越大,这件事,反而越重要。

因为我们自己就是做GPU服务器运维起家的,所以这次逛展,我特意多问了一句:你们的售后运维,打算怎么做?

得到的答案,出奇地一致:自建团队。

但再往下追问一句——你们现在的 FAE 工程师和技术工程师,有多少人?答案就没那么整齐了。

大部分厂商给出的数字,是 3 到 5 个人。

3 到 5 个人,要支撑一整条超节点产品线的现场故障排查、备件调度、液冷系统维护……说实话,这个数字,和展台上动辄上千卡的规模比起来,显得有点单薄。

为什么会这样?聊下来,大概有两个原因。

一个是产量确实还没起来。

今年展出的很多超节点,还处在POC测试或者小批量交付阶段,团队规模自然是跟着订单走的,订单没上量,团队也不会提前堆人。

但另一个原因,更值得说一说:售后运维,目前还不是大家真正重视的事。

这也能理解。当一款产品还在拼参数、拼首发、拼谁先把机柜立在展台中央的时候,售后确实很难挤进聚光灯。

大家更愿意讲"我这一柜能跑多少 EFLOPS ",很少有人愿意花时间讲"我这一柜坏了一张卡,多久能换上"。

但我们做了这么多年 GPU 服务器运维,看到的规律是:算力越集中,故障的代价就越大。

1024 张卡拧成一个统一算力池,任何一张卡掉线、任何一处液冷异常,影响的不是 1/1024 的算力,很可能是整柜甚至整个集群的训练任务中断重跑。规模越大,容错的窗口反而越窄。

所以我们始终觉得,超节点这场仗,上半场比的是谁的柜子更大、互联更快;下半场,比的一定是谁能让这些柜子,365 天稳定地转下去。

而这,恰恰是目前所有超节点厂商里,投入最少、也最容易被低估的一块。

这大概就是今年 WAIC 给我们最深的感受:算力的竞赛,正在从"造出更强的芯片",走向"把成千上万张芯片,拧成一台真正好用、稳定的超级计算机"。

而这场竞赛的下半场,才刚刚开始。

关注维云,带你了解更多AI 算力基础设施行业干货

WAIC超节点液冷

阅读公众号原文

需要为您的 AI 集群保驾护航?

交付、运维、维修全生命周期服务,7×24×4 全球响应。