来源:环球网
【环球网科技报道 记者 李文瑶】2026年,中国人工智能产业正处于一个微妙的时间节点。大模型从“百模大战”步入“应用深化”的下半场,行业关注的焦点已不再是单纯的参数量竞赛,而是如何将算力基础设施真正转化为高效、低成本的生产力。在这一进程中,一个长期被忽视却至关重要的短板正浮出水面——算力互联。
近日,基于中科曙光scaleFabric原生RDMA高速网络的Token加速技术体系正式发布。值得关注的是,该体系中IBGDA(InfiniBand GPUDirect Async)技术首次在国内实现规模化落地,并已在十万卡级大规模集群中完成全流程验证。这不仅是网络技术层面的单点突破,也标志着国产智算集群在攻克大模型算力“内耗”难题、打通数据流通“肠梗阻”方面迈出了从理论验证到工程化部署的关键一步,填补了国内IBGDA技术规模化应用的空白。
算力规模呈现爆发式增长
今年以来,算力基础设施的战略地位被提升至前所未有的高度。4月28日,中共中央政治局会议明确提出,加强水网、新型电网、算力网、新一代通信网、城市地下管网、物流网等规划建设。这一重磅部署,标志着算力网已正式上升为支撑国民经济高水平运行的战略性、底层基础设施。
“十五五”规划纲要则首次将“全国一体化算力网”纳入国家级基础设施体系,推动算力从孤立中心向协同网络演进。在算力建设方面,规划明确“适度超前”建设信息基础设施,有序部署万卡、十万卡及以上智算集群,并加大力度适配国产算力芯片。
在国家战略的强力推动下,我国算力基础设施建设正以前所未有的速度推进。截至2026年6月底,全国智能算力规模同比增长177%,达到每秒可执行2185百亿亿次浮点运算。全国算力设施整体上架率达71.4%。围绕“东数西算”八大国家枢纽节点,全国东西部主要地区已形成毫秒级算力服务圈。
算力不等于蛮力:网络互联成为制约国产算力效能的核心短板
然而,规模扩张的另一面是效率隐忧。单纯堆积GPU加速卡的数量,并不能带来算力利用率的线性提升。
当前,数据中心模型浮点运算利用率(MFU)仅为38%至43%——这意味着超过一半的计算资源处于闲置状态。研究表明,在大规模分布式训练中,网络通信耗时已占整体训练时长的30%至50%。顶级AI实验室在使用高性能GPU进行万亿参数训练时,模型算力利用率仅达35%至40%,高价芯片超过一半时间处于等待数据状态。推理场景下,预填充阶段的集中通信可占近一半执行时间。
国产算力集群面临的这一挑战尤为突出。在硬件层面,国产加速卡的单卡算力正在快速追赶国际先进水平;但在集群互联层面,如何让成千上万张卡高效协同、如何让数据在训练、推理与存储之间“飞驰”,依然是制约国产算力体系效能释放的短板。
如果将GPU比作“大脑”,那么网络就是连接这些大脑的“神经网络”。若神经网络传导迟滞、信号衰减,再多的神经元也无法形成强大的“超级大脑”。
从Token词元的生产视角审视,这一问题更加具象。词元从产生到交付,经历三段关键旅程:训练阶段通过All-Reduce等集合通信完成梯度同步;推理阶段在PD分离架构下搬运体积可达数十GB的KV Cache;存储阶段需在计算与存储之间持续读写并供AI Agent、RAG等应用复用。三个阶段均依赖网络的极致配合,任何一环的链路抖动或延迟过高,都会直接拖慢集群迭代周期、拉低MFU、延长TTFT(首Token时延)。在长上下文已成为主流配置的今天,这一矛盾愈发尖锐。
IBGDA突破CPU限制:在十万卡集群中完成规模化验证
正是这一背景下,IBGDA技术在国内的首次规模化落地,成为破解上述困局的关键突破口。
在此之前,GPUDirect RDMA(GDR)技术已允许网卡直接读写GPU显存,绕过了CPU内存中转,但通信操作的发起——如创建工作队列条目、写门铃通知网卡——仍需要CPU全程参与。在大模型训练中大量存在的小包通信场景下(尤其是MoE模型的All-to-All通信),CPU处理指令的时间远超数据传输本身,形成了严重的“CPU惩罚”。
IBGDA则实现了GDR的“二次进化” 。它允许GPU内核直接驱动和控制InfiniBand网卡,使GPU可以不依赖CPU,完全自主地发起和管理节点间的通信。其技术流程是:GPU内核直接在显存中准备好数据并写入工作队列,然后直接向网卡的门铃寄存器发起写入操作以通知网卡,网卡随后通过GDR技术从GPU显存中读取工作描述符和数据,完成后续的RDMA发送。整个过程从数据搬运到任务下发,全部在GPU上完成,实现了“GPU直达网卡”。
这一“去中心化”的通信模式,将小包通信效率提升了两个数量级,消除了长期以来困扰MoE架构大规模并发的“CPU惩罚”瓶颈。
尤为关键的是,中科曙光的IBGDA技术的规模化验证已在十万卡级集群中真实完成。 这意味着它已不再是实验室里的概念验证或小规模测试,而是在国内最大规模的AI算力基础设施中经受住了实际生产环境的严苛检验。据悉,scaleFabric在此次十万卡集群部署中,系统性地验证了IBGDA在超大规模并行训练场景下的稳定性与性能增益——从千卡级扩展到十万卡级,IBGDA在MoE模型的All-to-All通信场景中表现出了优异的线性扩展能力,通信效率未随集群规模扩大而明显衰减。
在性能验证层面,实测数据进一步印证了其工程价值。 大模型分布式训练和推理涉及多级网络交换,一个Token从源GPU发出,需依次经历接入交换机(Leaf)→汇聚交换机(Spine)→目标接入交换机(Leaf)三跳转发。在这一典型的两层CLOS架构下,scaleFabric展现出多跳性能:其单跳转发时延低至260纳秒,端到端(三跳)时延小于1微秒;以4KB以上的大消息报文为例,scaleFabric三跳时延较主流RoCE方案低约63% 。这一性能指标与英伟达NDR持平,达到国际一流水平。在PD分离架构的KV Cache跨节点搬运和MoE模型的All-to-All大规模通信中,这一低时延、低抖动的网络能力为Token生成提供了稳定、可预期的跨节点传输保障,确保集群规模越大、网络优势越明显。
scaleFabric成为国内首个规模化落地IBGDA技术的网络产品,并率先完成与DeepEP等框架的适配使用。IBGDA的落地并非孤立的技术突破,而是构建在完整的scaleFabric加速体系之上。
在大模型Token的三段旅程中,IBGDA解决的是训练和推理中GPU间的协同效率,而存储通道的优化同样致命。scaleFabric同步构建了三大存储加速通道——NVMe over RDMA让GPU通过RDMA网络直接访问远端NVMe存储池,存储访问延迟降低80%以上,大幅缩短TTFT;xDS(XPU Direct Storage) 允许加速卡绕过CPU直接访问存储,实现从存储到显存的零拷贝数据传输;NFS over RDMA让传统文件存储协议跑在RDMA网络上,有实践表明可将GPU利用率从约55%提升至95%以上,单轮训练时间减少30%至60%。三项存储技术与IBGDA结合,形成了“算-存-传”三级紧耦合的Token加速超级通道,让Token在训练、推理、存储全流程高速流转。
规模化落地:打破垄断与生态重塑
从芯片到操作系统到算力底座,国产AI正在实现全栈式突围。scaleFabric实现IBGDA国内首批规模化应用,并已在十万卡集群中完成全流程验证——这一事实本身即是国产高端网络技术成熟度的证明,填补了国产AI网络互联技术在超大规模集群中规模化部署的空白,标志着中国企业在AI网络这一关键底座上具备了与国际方案正面竞争的能力。
同时,这也是应对“推理时代”海量并发的必然趋势。 2026年,大模型应用正从“训练为主”转向“推理为主”。截至今年3月,我国日均词元调用量已超过140万亿,较2025年底增长40%。AI智能体一次任务要反复检索、读上下文、调用工具、多轮反馈,推理算力需求呈爆发式增长。IBGDA在降低小包通信延迟上的独特优势,使得国产集群在面对高并发、长序列的推理场景时不再有瓶颈和“吐字慢” ,为国产大模型商业化落地提供了网络侧的性能保障。
此外,全国一体化算力网的建设,不仅需要广域的网络调度能力,更需要集群内部的极致互联效率。IBGDA在十万卡集群中的规模化验证与性能实测数据,为国产万卡、十万卡集群的效能释放提供了可复制、可推广的网络方案,有力支撑了“十五五”规划中有序部署万卡及以上智算集群的战略目标。
IBGDA在国内的首次规模化落地,不仅是一次技术版本的迭代,更是国产算力产业走向成熟的转变。在“新质生产力”的驱动下,打通算力血脉的国产网络技术正由“可用”向“好用”蜕变。这既是一个里程碑,也是一个新起点。攻克了网络互联难关之后,国产AI算力方能真正“轻装上阵”,在大模型时代的全球竞技场中赢得属于自己的一席之地。