算力“新物种” 超节点来了
- 财富探索
- 2026-07-21
- 3690
当大模型参数从千亿奔向万亿,传统的服务器堆叠架构越来越“力不从心”——时延、带宽像两道无形的墙,把算力卡在了那里。2026世界人工智能大会(WAIC 2026)上,一个叫“超节点”的新物种亮相,成为全场焦点。
宋薇萍摄
什么是超节点?简单说,就是把一堆服务器变成“一台计算机”。
7月19日,WAIC大会期间,鹏城实验室(PCL)主任高文和全球计算联盟(GCC)理事长金海共同发布《超节点定义与实践白皮书》。
这份由GCC和PCL联合牵头,三十余家顶尖高校、科研院所、头部企业共同编撰的白皮书,首次完整厘清超节点核心定义、架构特征与核心技术体系,为全球下一代智能计算基础设施建设划定技术标准、指明演进方向、提供实践范本。
高文研判,超节点已成为AI基础设施建设全新范式。
据华泰证券4月一份研报测算,2028年中国超节点架构市场规模有望达到3414亿元,2026年至2028年复合年均增长率为194%,2026年也被称为“国产超节点元年”。
跨物理节点的统一内存编址
白皮书明确:超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。其中,跨物理节点的统一内存编址是超节点核心架构特征。“内存语义”和“统一内存编址”、超低时延、超大带宽共同构成超节点的三大技术特征。
白皮书收录了大量产业规模化部署与商业化落地案例,以海量实测数据充分验证:超节点已脱离理论构想阶段,成为技术成熟、可落地、可规模化推广的新型智算基础设施,在AI训练、推理全链路场景实现全方位性能突破,核心优势凸显:
——大模型训练场景:突破长序列训练瓶颈
超节点的统一内存编址,长序列(如128K/256K)训练时的全局BatchSize可大幅提升,无需频繁进行跨节点的Checkpoint保存和参数重分布,有效简化训练流程、降低资源损耗、提升长序列模型训练稳定性与效率。
——全域训练加速场景:打破传统通信壁垒
超节点大带宽可实现性能跃升,All2All性能相比RoCE提升16倍,可以实现All2All通信全掩盖,彻底打破“通信墙”,实现训练性能跨越式提升。
——RL后训练场景:实现训推完全异步解耦
超节点统一内存编址和超大带宽,以纳秒级延迟“流式”注入Trainer的TransferQueue中,彻底打破训推间的同步阻塞与网络拥塞,实现Rollout(推理生成)与Trainer(训练更新)的完全异步解耦,大幅提升强化学习后训练效率。
——低时延推理场景:极致降低推理延迟
超节点统一内存编址,允许单节点加载千亿参数模型的全部权重,并驻留超大规模的并发KVCache。Decode请求在节点内直接命中内存,避免了传统分布式推理中因KVCache跨节点迁移带来的巨大网络延迟,显著提升实时推理响应速度。
——大EP推理场景:大幅提升算力吞吐效率
超节点超大带宽、超低时延的特征天然亲和小包场景,进一步消除了“Prefill卡等Decode卡”的算力闲置,吞吐性能提升1.4倍以上,算力资源利用率最大化。
从“一枝独秀”到“百花齐放”
今年WAIC大会现场,华为、中科曙光、中兴通讯以及壁仞、沐曦、燧原等厂商纷纷亮出超节点的最新技术、产品和方案,超节点已从“一枝独秀”走向“百花齐放”阶段。
其中,华为首次公开展出昇腾950超节点(Atlas 950 SuperPoD)真机,而昇腾384超节点自2025年发布以来已规模商用750多套。华为公布的案例显示,昇腾超节点在低时延推理场景中,单卡性能相比传统服务器提升3倍,推理成本大幅下降。其核心支撑是灵衢互联协议,本次亮相的1024卡规模昇腾950超节点是目前业界规模最大的超节点,可实现256TB跨物理节点统一内存编址,RTT时延控制在3微秒以内。
中国首个全国产十万卡AI超集群——曙光8000(登峰)真机首次面向全球公开亮相,并入选WAIC 2026“镇馆之宝”。大会期间,曙光8000(登峰)公布最新运行数据:正式上线首周即需求爆满,应用满载运行,目前日均处理作业数突破15万个,单日处理作业峰值超过50万个。目前,曙光8000已依托国家超算互联网接入全国一体化算力网,完成300余项重点应用优化。
宋薇萍摄
中兴通讯发布OEX超节点新品,并联合曦智科技、壁仞科技、沐曦股份、燧原科技、天数智芯等合作伙伴,凭借“基于OEX+dOCS架构的国产高性能Matrix超节点”项目,再度荣登SAIL榜单,斩获本届SAIL之星奖项。
阿里云正式发布灵骏真武M890超节点实例,以超节点形态,为客户提供高速互联、开箱即用的64卡算力单元。这是阿里云首次通过公共云对外提供超节点形态的AI算力服务,标志着阿里云面向Agent时代的全栈AI Native基础设施实现关键跃迁。
白皮书揭示的另一个趋势是标准化进程的加速。在过去,各企业对超节点的定义不一、技术路线分散、产业链协同困难。白皮书的发布首次统一了术语和架构评判标尺,为后续芯片、整机、互联设备、算力软件等全产业链的协同迭代提供了共同语言。GCC方面表示,下一步将持续迭代超节点标准体系,推动各行业落地案例的丰富和常态化技术交流。
中科曙光副总裁王圣勇对上海证券报记者表示,从WAIC大会可以看到,AI和大模型都在走向可落地化阶段,作为AI基础设施,超节点超集群成为算力新基建比较明确的发展方向,因为它的生产力高,能有效解决客户模型集中化的问题。可以预见的是,以超节点超集群为代表的算力基础设施将成为市场采购风向标。中科曙光将持续深化产业落地布局,未来也计划在上海落地产业园和高端产线。
(文章来源:上海证券报)