欢迎user

近日,谷歌云荷兰europe-west4-a可用区因上游电网故障引发连锁反应,导致制冷失效、机房高温,核心服务中断近15小时。这一事件再次敲响警钟——对于动辄万卡规模的AI大模型训练而言,单机房在电力、空间与可靠性上的物理天花板已清晰可见,万卡集群的下一站,必然是通过多中心互联,在地理上分散风险,在逻辑上聚合算力。
然而,多数据中心协同,难在“无损”而非“连通”。百公里物理距离引发的延迟震荡,让传统拥塞控制机制几近失效。这要求架构层面必须打破地域隔阂,将跨地域分布的GPU集群视作逻辑上的单一节点。以此为攻坚方向,紫光股份旗下新华三集团基于高密800G智算DCI交换机S12500R-64EP推出Scale-Across协同训推解决方案,通过软硬协同优化,真正实现跨地域算力无损协同。

长距RDMA加速
为网络拥塞配备“现场指挥”
在跨中心分布式训练与推理场景,统一作业内的成千上万个GPU需打破物理园区局限,进行协同计算与数据同步。一旦链路拥堵,传统机制依赖接收端回传拥塞通知,而在百公里距离下,这一来一回往往耗时数十甚至上百微秒。待“减速”信号抵达时,往往为时已晚,轻则丢包,重则带宽闲置,算力严重浪费。
新华三Scale-Across方案将拥塞控制权限下沉至DCI边界交换机,如同在每一个交通要道部署了“现场指挥”。基于创新的FastCNP(快速拥塞通知)机制,交换机无需等待接收端反馈,一经探测到拥塞苗头,即刻原地生成并发送通知。实测数据显示,拥塞响应速度提升81.4%,整体吞吐量提升11%,确保目的地即便远在百公里之外,依然畅行无阻。

32GB HBM超大缓存
为流量洪峰筑起“超级缓冲池”
跨数据中心训练的流量特征极具挑战:多个中心汇聚而来的周期性“流量洪峰”,往往让传统交换机的有限缓存瞬间溢出。而在长距RoCE网络中,一次丢包引发的重传代价极高,直接导致远端GPU陷入漫长的空转等待。
新华三DCI交换机内置 32GB HBM高带宽缓存,相当于在两座数据中心之间修建了一座巨大的“超级缓冲池”。它可稳稳接住瞬时的流量洪峰。但仅有容量还不够,若数据在池中滞留过久,时延又将攀升。为此,方案引入了距离感知智能缓存调度技术,根据链路时延动态调节,不仅在洪峰时稳稳承接数据,确保零丢包;更是在日常运行时精准“控水”,实现了大缓存与低时延的最优平衡。

800G彩光直连
为同城互联铺设“全光高架”
传统跨园区互联中,信号进出光纤前往往需经历繁琐的“光-电-光”转换。这不仅增加了额外时延,更推高了设备成本与架构复杂度。
新华三通过800G ZR彩光直连技术彻底简化了这一流程。新华三DCI交换机支持彩光模块与光层板卡直连,省去了昂贵的OTN电层转发环节。这相当于为同城网络修了一条“高架直达通道”,既消除了不必要的转发时延,又让单根光纤同时承载多路800G信号,大幅节省光纤资源。架构的极简带来了成本的骤降,整体建设成本减少约45%。
AD-DC智算版
为跨域运维装上“超级大脑”
百公里虽近,管理一旦跨域,极易形成“信息孤岛”。新华三通过AD-DC智算版将散落在各处的物理网络整合成一张逻辑大网,全网拓扑一目了然,流量调度、设备状态、光模块健康度尽收眼底,策略一键即可自动化下发。运维人员能像管理本地机房一样,轻松驾驭全局。

从“单点供给”走向“多中心协同”,已是智算基础设施建设的大势所趋。新华三集团将继续深耕广域无损网络技术,以确定性网络承载不确定性挑战,为百行百业的AI大模型训练与推理提供坚实的网络基石,让每一份算力都不被浪费,每一次协同都畅通无阻。

