首页财产阐发评论ai正文 2026年下半年,算力竞赛为什么忽然转向超节点? 2025年超节点成热门,海内厂商纷纷结构。本年因训推需求年夜、效能高、可批量交付而发作,技能线路有不合,竞争已经最先。 2026-07-27 08:50 ·微信公家号:数智火线 文|赵艳秋 编|牛慧 文|赵艳秋 编|牛慧 AI投资人解读· 超节点可晋升GPU使用率,降低单元Token成本,已经成为AI Infra设置装备摆设主流趋向。海内浩繁厂商介入,形成三条技能线路。因模子练习及推理需求年夜增、性价比高、可批量交付,超节点于本年发作。 · 技能线路存于范围、CUDA兼容平分歧,供给链也面对挑战。 总结:超节点市场远景广漠,但技能线路尚待明确,供给链存危害。投资时需存眷厂商技能实力、交付能力和供给链不变性,综合评估其于超节点赛道的竞争力与成长潜力。
“中国年夜型互联网企业会于下半年年夜量部署超节点方案。”一名算力资深人士告诉数智火线市场的走向。虽然超节点整机价格凡是高在划一卡数的平凡办事器,“但它的账算患上过来,算力密度更高、空间占地更小。此刻企业必需于有限空间承载更多算力,超节点是个‘年夜杀器’。”新华三人士增补道。
即便此前没有采用超节点的DeepSeek,“近来也明确要用,正于议价。”一名云计较年夜厂人士告诉数智火线,这具备风向标意义。
这一热潮于2026世界人工智能年夜会上体现也很凸起。华为展出了20个机柜构成的1024卡超节点真机、中科曙光展示了沸腾着冷却液的640卡超节点,baidu天池、阿里云灵骏真武M890、海潮信息元脑以和沐曦曦景S600,都被放于各自展台的凸起位置。
甚么是超节点?简朴来讲,它经由过程高速互联技能,把年夜量GPU或者加快卡从“多台办事器”深度整合成逻辑上像一台“超等计较机”的体系,解决了传统集群跨呆板通讯的带宽及延迟瓶颈,从而年夜幅晋升GPU或者加快卡的使用率,带来单元Token成本的降落。“超节点已经成为今朝AI Infra设置装备摆设的一个主流趋向。”华为资深人士对于数智火线说。
一年前,超节点还有是少数厂商展示体系能力的旗舰产物;一年后,它正于成为主流算力企业必需介入的武备赛。“国产超节点从去年推出,今朝已经成长到可批量落地阶段。”baidu昆仑芯人士说,“到本年底,每一家算力企业基本上都具有交付能力。”
0一、谁于造超节点
超节点不是新观点了。2024年,英伟达发布GB200 NVL72,将72颗Blackwell GPU纳入一个高速互联域,鞭策该架构进入业界视线,但最初需求其实不算旺。到2025年,跟着年夜模子参数暴涨,超节点才成为热门。海内厂商也早于2024年先后最先做技能预研,最早一批于2025年上市,华为、baidu智能云、海潮信息、新华3、复兴等各家都最先发布。超节点赛道最先涌入多个玩家。
但各家争取的核心不太同样,今朝好像形成为了三条差别线路:一派不停扩展单个超节点的范围,一派更夸大部署效率及经济性,还有有一派试图用新的芯片及互联架构从头界说超节点。
数智火线不雅察,此中华为、中科曙光及baidu,于走向“年夜节点”。
华为已经向业界展示由20个机柜构成的1024卡的昇腾950超节点真机,并将于本年第四序度批量交付8192卡超节点,理论上这是该超节点满配技能上限。华为的判定是,跟着年夜模子参数、上下文长度及推理并发量连续增长,单个计较域需要容纳更多芯片及更年夜的内存空间。而其去年推出的384卡超节点已经于互联网、金融、能源、教诲及医疗等行业,商用落地750多套,证实了超节点的贸易范围部署能力。
中科曙光选择了浸没式液冷支撑更高密度部署。单机柜640张加快卡,一台冷却装备带两个机柜。由这一超节点构建的十万卡算力集群曙光8000(登峰),已经落地国度超算互联网郑州焦点节点。“今朝已经跑满了90%,许多需求来自模子练习,也有AI for Science。”曙光人士告诉数智火线。
baidu智能云天池超节点则从256卡向512卡演进,后者将于年末推出。它夸大从互联和谈、互换芯片到液冷体系的全栈自研。baidu智能云混淆云部总司理杜海先容,其超节点已经经交付多个万卡集群。文心5.1主要版本的练习于天下产集群上完成,能源电力行业支撑80多个行业场景推理,也支撑了自研电力年夜模子的练习。
另外一批厂商其实不认同“越年夜越好”。
阿里云推出的灵骏真武M890,以64卡为一个Scale-up单位,再经由过程Scale-out收集扩大至更年夜集群。与大都超节点重要面向私有化部署差别,阿里还有将这类算力形态放到大众云上,客户没必要采购装备,也能够按需挪用。
海潮信息、沐曦也选择了近似标的目的。海潮信息去年推出64卡超节点,本年再推32卡产物。32卡可以支撑万亿年夜模子推理。海潮信息副总裁赵帅先容,“咱们本身内部用万亿年夜模子做AI Coding,效率*比用千亿年夜模子好。这就是万亿参数年夜模子带来的价值。以是再次推出32卡产物,让更多企业真正用患上起。”沐曦则以单柜64卡为基础,夸大CUDA生态兼容及向万卡集群的横向扩大。
还有有一些厂商试图跳出英伟达GPU或者华为加快卡线路,走了第三条路径。清微智能采用可重构数据流架构,每一颗芯片同时负担计较及数据转发,芯片之间可直连,无互换机。清微智能产物副总裁陈逸伦告诉数智火线,已经推出4096卡、峰值算力为500PFLOPS的超节点。北京某练习场已经部署,内蒙、新疆、浙江的金融行业、国央企也已经落地。采用一样线路的还有有7月产物方才上市的东方算芯。
此外,摩尔线程也规划年末陪同新一代GPU推出相干产物。寒武纪虽然今朝没有超节点,但业界判定下一代芯片也将推出超节点。至此,海内重要算力芯片、办事器企业,险些都已经进入这一赛道。
0二、为何是本年
超节点为何会于本年发作?业内认为有三年夜缘故原由。
*,模子练习及推理需求充足年夜。练习端,模子参数目于飙升。7月Kimi发布参数达2.8万亿的年夜模子K3。“下一个春节,模子参数会酿成3万亿,再下一个6万亿,于后面是10万亿。而海外中等范围模子参数目已经达5万亿。”沐曦CTO杨建博士告诉数智火线。业界凡是认为,1万亿参数模子练习需要约5000张卡,3万亿参数模子约莫需要1万张卡,6万亿需要2万张卡练习。解决方案*是把多个芯片连成一体化去运作。
推理端,华为人士举例,AI Coding场景中,一个使命触发的操作挪用已经是几万次,繁杂长程使命是几十万甚至上百万次。“这象征着更多并发、更长上下文,这恰是超节点年夜内存池的焦点卖点。”从训推需求比例来看,阿里云资深人士告诉数智火线,今朝线上推理及练习比已经靠近5:1~10:1,“1万张卡里,约莫70%~90%都于做推理,只有少部门于做练习”。
第二,账算患上过来。超节点的价格比一样卡数办事器总价要贵,但客户算的是整体效能账。“你不克不及单看卡的数目,它触及风火水电基础举措措施,超节点更集约。为何年夜企业都去部署超节点,必定是算患上过来这个账。”新华三人士告诉数智火线。海潮信息副总裁赵帅曾经举例:“经由过程超节点,假如推理机能晋升10倍,但耗电可能只晋升2倍,算下来还有有收益的。”
昆仑芯人士先容,传统模式下10台呆板的算力相加不等在10,“只能等在6”,超节点经由过程高速互联把损耗降到*,让更多算力阐扬效能。如用超节点做PD分散推理,体系比平凡同卡数呆板晋升30%到50%的机能。
第三,批量交付节点到了。“超节点是工程化产品,它包罗GPU芯片、存储、通讯、互换、散热、供电、软件,不是单一厂商能自力弄定的。”昆仑芯人士说,“今朝,超节点已经成长到可批量落地阶段了。”另外一位人士增补,“不管机能做患上怎么样,各人均可以把整机交支付来”。

不外,超节点更合适练习还有是推理?各家的说法其实不同。
华为人士认为,练习、推理都有价值,万亿参数年夜模子练习需要巨年夜内存池,Agent推理需要海量上下文并发,超节点要具有年夜内存卡。摩尔线程认为,超节点要面向1万亿到5万亿参数年夜模子练习,以和高速推理的tokens工场场景。而沐曦人士认为,“颠末周密论证,超节点于推理的Decode阶段,也就是逐Token天生谜底时,价值更为凸起。”清微智能陈逸伦阐发,“今朝超节点于练习侧跑微调较多,拿它做推理机能更好。”
0三、不合与共鸣
爆火之下,超节点技能线路有诸多不合,今朝还有没有尺度谜底,取决在各企业的技能贸易判定。
*个不合是范围之争,超节点应该做多年夜?是64卡/128卡,还有是更年夜范围?行业分成两个阵营,这里说的是超节点Scale-up的范围,就是用高带宽、低时延互联,把几多芯片纳入一个紧耦合计较域。
一些企业人士是“末节点派”。“于我小我私家认知里,64卡就够了。TP并行、EP并行的*范围可能就是64卡,剩下的经由过程PP及DP并行、Scale-out去连起来。你不必把单个节点的Scale-up做到充足年夜,由于任何通讯都有延迟,TP及EP对于延迟极端敏感,即便千卡互联中间几个微秒的延迟,GPU实在都于等。”一名人士告诉数智火线,“对于时延及不变性都要有思量,这是一个工程上的均衡,其实不是scale up越年夜越好。”另外一位人士持不异态度,“64到128卡是最经济的形态,再年夜就华侈了。”
另外一些企业则是“年夜节点派”,华为最新超节点扩大至1024卡,中科曙光640卡,baidu天池、新华三均推进至512卡。“进入Agent时代后,万亿参数、百万Token上下文及海量并发推理下,64/128卡末节点同一内存池过小”,“64卡更像基础机柜单位,合适中小范围模子微调、离线推理;万亿年夜模子完备练习、年夜范围多智能体并发,必需依赖更年夜范围超节点”。
第二个不合是CUDA兼容之争。阿里平头哥、沐曦、海光等走CUDA兼容线路,代码迁徙成本低。华为昇腾、昆仑芯等走自研生态线路。
一名年夜厂人士对于数智火线阐发,自研生态虽然迁徙成本高,但可控性及持久演进空间更年夜。他坦诚,或许两三年后,CUDA兼容就没有那末主要了。“咱们回归技能*性,CUDA昔时的胜出,是许多人做向量编程,心智承担很年夜,而CUDA方案让人于心智上的泯灭极年夜降低,以是于已往10多年取患上乐成。但到今天有了Agentic coding后,纷歧定是人去编程,都走向让Agent去干,以是CUDA就不那末主要了。”
一名华为人士先容,华为是海内*撑持mxfP8及fp4精度的厂商,mxfP8的可变量比fp8更好。“有人说昇腾从CANN走向了CUDA,实在其实不彻底准确。”他说,“华为加强了向量处置惩罚能力,而英伟达加强了矩阵处置惩罚能力,两家都走向了‘矩阵及向量综合型’标的目的。”
还有有其他的不合,如毗连中铜缆与光纤,液冷中的风冷及液冷,特别是浸没式液冷,这些新旧技能转换中,因技能瓶颈、妨碍率与运维成本孕育发生的抵牾及挑战,让业界有差别的技能贸易选择。
一个共鸣是软硬架构协同。超节点演进与模子技能线路紧密亲密相干。海内模子架构怎样演进?阿里人士告诉数智火线,海内模子企业Attention正于分解为两条线路,此中千问GDN、Kimi KDA走向Linear Attention;DeepSeek走Smart Attention(MLA、DSA、CSA),智谱今朝也采用DeepSeek 3.2的DSA架构。两个阵营相对于自力,仍需不雅察将来两三年的演进,这也将影响超节点的硬件适配标的目的。
海潮信息董事长彭震近来先容,已往基础举措措施重要沿摩尔定律演进,近来的新进展是软硬件结合立异,一端提出新算法,另外一端用新介质、硬件及收集适配,收益显著。他看到美国企业也于开展近似摸索。
于沐曦杨建博士看来,这条赛道“将来二三十年都停不下来”。本年,他已经看到一些企业最先用AI介入设计,门路、衡宇、机械等设计素质上都属在常识出产,AI的影响早已经凌驾coding,正于渗入到各行各业。一名年夜型企业治理者但愿,到2027年末实现“白日开会写规范,放工前交给年夜模子,第二天看成果”,人卖力界说及发明问题,年夜模子卖力求解。今朝,AI常识创造的进程,“许多企业还有没最先,由于总司理及董事长还有没作出对于数字员工的定岗决议。”资深人士不雅察。这恰是AI要渗入的市场。
而算力越自制,行业扩张就越快,“整个链条就再也停不下来了”。美国算力约为中国的9倍。超节点正成为这条财产链向下延长的主要算力底座。跟着更多厂商具有整机交付能力,真正激烈的竞争已经经最先。
“此刻比拼的是可否批量交付、不变运行,并真正降低每一Token成本。”一名年夜厂人士说。供给链是此中更年夜的挑战,“不管国产还有是海外供给都存于不足。锁定供给链,将来成长才更有确定性。”
【本文由投资界互助伙伴微信公家号:数智火线授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-lehu乐虎88国际