304永利集团官网入口-基石筑底|WAIC 2026算力:超节点与光互连,能否绕过单芯片的物理天花板?
首页财产芯片半导体正文 基石筑底|WAIC 2026算力:超节点与光互连,可否绕过单芯片的物理天花板? 2026年算力竞赛进入新阶段,财产重心转向推理。WAIC 2026从架构、技能、生态及工程四方面给出体系级谜底,鞭策中国算力走向系统化协同成长。 2026-07-03 13:46 ·投资界综合 WAIC WAIC AI投资人解读· 文章指出2026年财产重心从练习转向推理,推理算力范围反超练习。超节点经由过程高速互联技能削减数据传输等候时间光技能被视为后摩尔时代破局要害开源协作打造同一智算底座,存储成为算力生态焦点工程落地经由过程算力调理、散热收集等降低单Token成本。 · 行业竞争激烈,技能成长迅速,可能面对技能迭代危害生态设置装备摆设仍需完美,存于软硬件协同不足等问题。 总结:中国算力迈向“体系时代”,于架构、技能、生态及工程方面有诸多立异,具有投资潜力,但需存眷技能迭代与生态设置装备摆设危害,可进一步评估其于行业中的竞争力与成长远景。
当算力竞赛从“单卡比拼”进入“体系级主权竞争”新阶段,权衡尺度再也不是单芯片峰值,而是整套体系能把算力用多满。
2026年,财产重心已经从练习转向推理,推理算力范围反超练习,算力从科研东西变为全行业通用基建,成为天天必需付出的运营成本。行业再也不问“有几多张卡”,而是问“有用算力是几多”。集群线性度每一晋升10个百分点,硬件成本降15%、电费省20%,万卡集群象征着数亿元的真金白银。
当单芯片迫近物理极限,靠甚么支撑有用算力的连续增加?WAIC 2026的“基石筑底”篇章,从架构、技能、生态及工程四方面给出了体系级谜底。
0一、架构破局:超节点可否打破单芯片的物理天花板?
单颗芯片的机能快到天花板了,算力范围继承做年夜,只能靠一件事,那就是把更多芯片用更快的方式连起来。这就是“超节点”于做的工作。
传统做法就是堆卡,并且越多越好。但这条路越走越窄。GPT-5级另外年夜模子练习,跨节点通讯开消占了总练习时间的三成以上。也就是说,买100张卡的钱,有30张卡的时间于干等数据。GPU算力每一年晋升2到3倍,但内存带宽一年只涨15%到30%,二者之间的差距愈来愈年夜。
超节点解决的就是这个问题,经由过程高速互联技能,把几十甚至上百颗GPU酿成一个同一的“计较矩阵”,让本来需要跨机柜传输的数据酿成内部通讯,年夜幅削减等候时间。
华为于WAIC 2026全世界真机首展Atlas 950 SuperPoD,这是今朝行业范围最 年夜的商用超节点。单柜64卡起步,至多可以连8192张NPU卡,专门为万亿参数的年夜模子练习及推理设计。华为还有提出了一个叫“韬定律”的新思绪,与其死磕晶体管尺寸,不如压缩旌旗灯号传输的时间延迟,用架构立异于成熟制程上跑出高机能。

Atlas 950 超节点
复兴通信秉持开放解耦理念,结合曦智科技、壁仞科技、沐曦股分、燧原科技、天数智芯等互助伙伴,构建基在OEX+dOCS架构的国产高机能Matrix超节点。主意多芯协同,面向差别运用场景,自立选择国产最 优芯片组合,打造TCO最 优的算力底座,该立异架构已经入围本届WAIC的SAIL奖。国产各种芯片厂商同心合力配合打磨一套体系,这件事自己就是旌旗灯号——中国算力正走向系统化协同成长。
0二、技能思辩:后摩尔时代,光互连是唯 一的技能线路吗?
超节点解决的是“怎么连”的问题,光技能解决的是“用甚么连”的问题,后者更靠近物理底层。
摩尔定律放缓这件事,行业已经经再也不争辩了。晶体管越做越小,成本愈来愈高,收益愈来愈低。电旌旗灯号生成有发烧及带宽上限,内存墙及互连墙这两堵墙,靠电子技能很难翻已往。光纷歧样。光子的传输速率比电子快患上多,并且不发烧、不耗电,自然合适做年夜规模高速数据传输。
光互连给算力集群修的是“数据高铁”,光计较则直接用光子做运算,绕过电子电路的物理极限。这两项技能加于一路,被行业视为后摩尔时代最有但愿的路。
本钱已经经用脚投票了。2026年曦智科技于港交所上市,被称为“全世界AI硅光芯片第 一股”。本届WAIC,曦智将举办年夜会汗青上第 一场光技能专场论坛。传统电芯片受限在摩尔定律放缓与“内存墙”“互连墙”,算力供应严峻滞后。是以,光技能成为破局的要害,光互连为算力集群提供低时延、高带宽、低能耗的支撑;光计较使用光子并行性与线性运算上风,绕过电子晶体管微缩极限。光技能专场论坛实其实于地展示光互连及光计较于智算集群里怎么落地,正面回应“光能不克不及替换电”这个行业终 极问题。

天枢·光立方
一个愈来愈清楚的共鸣是:于超节点这类年夜范围集群里,光技能不是可选项,而是必选项。华为的Atlas 950、复兴的OEX,全都靠光模块实现万卡级互联。借助WAIC顶 级行业平台,展示海内自研光算力技能方案,开放交流、共建算力生态。
0三、生态突围:开源协作可否打破“一卡一软件”的碎片化困局?
硬件架构连续改造,光互联技能不停演进,借使倘使软件与存储配套能力跟不上,算力依旧难以跑满,生态底座必需同步进级。
此刻全世界有上百家AI芯片厂商,每一家都有本身的编程模子、算子库、通讯和谈。一个模子从英伟达的卡迁徙到国产芯片,往往要从头编译、从头优化,成本极高。算力碎片化的成果就是硬件越买越多,真正能用起来的却不到四成。
本年由图灵奖患上主年夜卫·帕特森(David Patterson)亲自领衔的全世界AI开放计较与智能体技能生态论坛,对准的就是这个问题。焦点方案是一个叫FlagOS的同一智算底座。也能够理解为给所有芯片做一个通用的“操作体系”,让差别架构的芯片能跑统一套软件。

更值患上存眷的是,这场论坛约请到Linux、Eclipse、PyTorch三年夜国际开源基金会,用开源协作替换厂商锁定。这是国产算力第 一次拿到国际通行的“软件护照”。
还有有一个持久被纰漏的脚色,那就是存储。行业里所谓的“I/O墙”,素质上是冯·诺依曼架构中存储与计较速率不匹配的固有瓶颈——计较单位算力连续跃升,而数据供应效率没法同步跟上,致使GPU因等候数据而频仍处在余暇状况。
存储是买通软硬件协同、实现生态闭环的焦点底座,也是持久被低估的要害生态短板。西部数据初次参会并专设“面向AI时代的数据存储架构”论坛,聚焦存储、算力、安全一体化生态协同的难点与冲破口,补齐算力生态碎片化的末了一环。其行业调研明确印证:头部企业AI落地的焦点竞争力,不于在单芯片硬件极 致机能,而于在存、算、安的全域生态协同能力。当前算力生态遍及存于布局性割裂,海量数据沉淀闲置、没法融入算力调理系统,致使昂贵的GPU算力因数据供应链路欠亨、生态适配不足难以满血阐扬。这也让存储完全跳出传统硬件配套的副角定位,成为贯串算力生态、决议集群总体效率与综合成本的焦点要害。
算力生态的短板,不只是芯片间的软件栈割裂,更是计较与存储之间的协同断裂。FlagOS同一智算底座解决的是前者——让差别架构的芯片跑串通一套软件;而存储协同优化要解决的是后者——让海量数据于准确的时间呈现于准确的位置,把GPU从“等数据”的状况中解放出来。两块短板补齐,算力生态才算真正闭环。
美国数据编排公司Ha妹妹erspace将展出高机能全局数据平台,恰是针对于这一痛点的解题思绪。其焦点冲破于在Tier 0功效,能将肆意厂商的NVMe存储刹时转化为超高机能存储层,无需裁减现有装备。实测数据显示,客户可于1.5天内激活20PB的Tier 0容量,实现100%线速机能,GPU使用率晋升40%以上,每一TB基础举措措施成本降低50%。
该平台的怪异性表现于同一全局定名空间,于边沿、数据中央与云端构建无缝数据视图;智能数据编排引擎,经由过程主动化数据挪动让数据于准确时间呈现于准确位置;彻底基在pNFS、NFS、SMB、S3等尺度和谈,无代办署理架构不侵入GPU节点,降低耦合与运维危害;计谋驱动的主动化编排可将10多个存储平台收敛为1个同一数据治理平台。
这条路今朝看,已经经开端走通,I/O墙已经被局部击穿,形成阶段性解决方案。
0四、工程落地:单Token成本怎样从130万压到35万?
技能再好,落不了地便无心义。WAIC 2026展览层出现的,恰是从观点到工程的要害一跃。
算力调理是降本的第 一把钥匙。这次无问芯穹带来智能体时代的“Token超等工场”,缭绕“前店后厂一中央”的全栈技能结构,集中出现自立可控的Agentic Infra自立式基础举措措施与Agentic MaaS年夜模子办事平台,以和AI出产力运用展示。经由过程跨集群异构PD分散技能,联合自研的全栈推理优化东西,于万亿参数级模子上,推理成本较传统单实例模式降低10倍,实现从国产算力到AI运用出产力转化效率的极 致重塑。

AI出产力公式
散热与收集,是别的两个被轻忽的降本杠杆。行将展出的“Shanghai Cube”单柜128卡液冷机柜已经真实运行DeepSeek 671B年夜模子。该产物是算丰信息结合立讯、沐曦、云合、道客、无问芯穹、复旦年夜学、创智学院及模合信息等多家机构,配合开发的国产自立软硬件一栈式高密度算力装备。单柜功率密度冲破100kW,传统风冷方案凡是止步在20-30kW/柜,凌驾这一上限后,液冷再也不是可选项,而是唯 一前途。实测数据显示,液冷方案可将PUE值降至1.05如下,比拟传统风冷数据中央节能40%以上。
于年夜范围超集群工程落地层面,中科曙光携scaleX万卡超集群重磅表态,依托自研开放AI架构,兼容多品牌国产加快卡与CUDA生态,总算力冲破5 EFlops,首创超算、AI双计较交融范式,撑持8–64位全精度运算,依附scaleFabric无损高速收集解决十万卡集群调理难题,搭配自研浸没式液冷实现1.04低PUE。

scaleX万卡超集群
同场新华三业界单芯片带宽最高的102.4T智算互换机,一跳直接降低延迟。于年夜范围漫衍式练习中,收集堵塞致使的算力损耗可高达30%以上。新华三经由过程算网协同调优,使练习机能晋升30%、模子练习历时缩短25%,一样的硬件投入得到更多有用产出,单Token成本随之降落。

AI芯片高速互联立异技能架构
从超节点降损耗、光互连降能耗,到中间层降适配成本、同一存储降资源耗损,全链路于做统一件事,那就是把单Token的综合成本压下来。这才是算力从“造患上出”到“用患上起”的真正超过。
0五、体系为王:从单卡竞赛到体系级国力竞争
中国算力正从“堆卡时代”迈向“体系时代”,单芯片迫近物理极限,体系级协同立异成为下一代算力竞争的要害。
上海已经建成承载16万P异构算力的同一算力调理平台、每一年10亿元算力券、全财产链支撑底座,形成独占的体系级集群上风,既是财产制高点的底气,也为国度算力自立可控孝敬“上海方案”。

而本届WAIC集中出现的中国算力基础举措措施完备自立技能图谱——超节点集群、光互连技能、跨芯片同一算力基座,不只是算力的“量”,更是算力的“魂”。
附录:WAIC 2026算力论坛






