曦智科技的光交换进击之路

2026-07-23 15:40:34 来源: 李寿鹏
点击
在大模型规模不断扩张、单芯片性能提升空间逐步收窄的背景下,如何通过系统级架构创新打造高效算力集群,正在成为全球AI基础设施发展的关键课题。这也正是这些年来超节点爆火的原因之一。但是,随着集群规模越来越大,传统集群的网络瓶颈逐渐凸显。
 
熟悉集群的读者都知道,迄今为止,大多数集群的数据交换都是依赖交换机和二层网络等固定网络拓扑。在集群GPU数量还少的时候,这种方案的局限性尚不明显。然而,随着集群越来越大,带宽被大量分摊、网络效率下降。叠加传统电分组交换(EPS:Electrical Packet Switching)带来的巨大能耗增加,会给集群带来巨大负担。
 
正是在这一背景下,OCS (Optical Circuit Switching:光电路交换)应运而生。

 
被看好的OCS,曦智提前卡位
 
OCS的走红,其实是“Tokens经济”发展的必然结果。
 
回顾这些年的人工智能发展,从一开始专注于训练,到现在推理和训练平分天下,行业除了大力发展超节点,追求算力提升以外,如何打造具备更低成本的集群,也成为了所有从业者的共同目标。有行业人士就曾经分享过,虽然训练也很关注成本,但更关注效率、质量,不能有中断,训练的时间也要有保证。但来到推理,情况截然不同,百万级token的成本已是重中之重,有人甚至认为这是决定大模型企业未来的最终胜负手。
 
在这种动力的驱动下,除了从功耗和算力芯片成本中寻找提升空间,作为超节点的重要成本构成之一的网络,就成为了突破的方向。可以毫不夸张地说,高性能互连网络是决定超算与智算系统可扩展性的关键因素。随着集群从千卡到万卡、甚至十万卡演进,如文章开头所说,EPS成为了第一个可替代的方向,率先采用OCS的谷歌成为其中当之无愧的先驱。
 
在谷歌看来,采用OCS,能利用光学方式直接建立数据通路的交换设备,在数据中心内部动态调整光纤连接关系,从而减少对传统EPS的依赖,进而打破功耗、成本和扩展等瓶颈;对于OCS来说,还有另一层重要意义——不依赖于特定的数据传输协议,可无缝兼容不同厂商使用的互连协议,消除生态壁垒带来的潜在风险。
 
除此以外,OCS还改变了传统网络“固定连接”的方式,将 AI 集群网络变成一种可动态重构的互连体系,这对集群带来的提升是前所未见的。传统网络中,服务器和交换节点之间的连接关系通常是预先设计好的,网络拓扑相对固定;而 OCS 可以根据不同 AI 工作负载的通信需求,通过光交换重新配置节点之间的连接关系,让同一套硬件资源适配不同训练任务。
 
综上所述,OCS并不是简单意义上的“直连”,而是一种“可重构的直连”,既保留直连网络低延迟、高带宽的优势,又具备动态调度能力。
 
正因看到了OCS的上述优势,深耕光技术多年的曦智科技早已切入这条赛道,并推出了分布式OCS全光互连模块——dOCS。在去年WAIC期间,上海仪电联合曦智科技、壁仞科技、中兴通讯,基于这个核心技术,正式发布国内首个光互连光交换GPU超节点——光跃LightSphere X,并在今年三月实现“光跃128卡商用版”的正式落地。
 
到今年的WAIC,曦智科技不仅实现了光跃超节点的数千卡成果落地,更完成了光交换技术的又一次创新——推出业界首创Scale-Up光电混合组网方案。基于该方案,曦智科技与四大国产GPU公司(壁仞科技、沐曦股份、燧原科技和天数智芯)和中兴通讯合作了“基于OEX+dOCS架构的国产高性能Matrix超节点关键技术与应用”项目。
 
值得一提的是,凭借其先进性,该项目获得了2026世界人工智能大会SAIL之星奖项。

 
从OCS到dOCS,再到OEX+dOCS
 
眼尖的读者可能已经发现,在上面的介绍中,我们讲谷歌的时候用的是OCS,但到了曦智这里却讲的是dOCS。要厘清这两者的区别,就要从各自架构的组成说起。
 
据了解,谷歌采用的是一个“中央式OCS”解决方案,通过一个被称通过微机电系统(MEMS)等技术调整内部微镜,使得OCS 能够在不进行任何光电转换的情况下,直接改变光纤中的光路方向,这种“纯光传输”带来了颠覆性的优势。但随之而来的挑战,也是有目共睹的。
 
分析人士告诉笔者,要实现这个上述目标,不但要求厂商打造专门 OCS交换设备、搭配特殊定制光模块以及多波长DSP,还要求厂商在微镜控制算法、软硬件协同调度,到上层 AI 编译器的全栈自研能力。缺少任何一环,光路重构的开销都会让系统性能不升反降。这也是为什么多年来只有谷歌等极少数巨头能真正用好 OCS。
 
据笔者了解,传统OCS目前之所以尚未大规模用于数据中心,主要受限于两点:一是可靠性风险——大量光纤集中接入同一台设备后,一旦该设备故障,会波及所有接入光路,故障影响面被放大,这对大型数据中心是较大隐患,业界仍在持续研发应对方案;二是成本较高,制约了规模化部署。
 
在意识到上述问题后,曦智放弃了单体庞大的中央式 OCS 结构,选择了分布式OCS(dOCS)不再把交换功能集中做进一台大盒子,而是分散到模块中实现。
 
从外形上看,曦智的dOCS接近光模块,但内部集成了交换功能。这一架构带来两大优势:一是可靠性更高,因其为硅光固态产品,不依赖集中式盒子结构;二是成本更低,因dOCS自带光电转换,系统整体所需光模块更少(传统方案GPU互连需4个光模块,dOCS方案仅需2个),还能省去电交换环节。可以说,这是技术架构、产品形态与应用场景结合的创新,也体现了曦智在这一领域的综合把控能力。
 
曦智同时认为,在高密度节点内部保留低延迟、高效率的EPS,在跨机柜和大规模集群扩展环节引入 OCS 光交换的光电混合架构会是一种目前更容易落地与部署的方案。采用OEX(Orthogonal Electrical Exchange:正交电互连交换架构)+dOCS架构的“国产高性能Matrix超节点”正是通过在GPU 机柜内部经 EPS 完成全交换,再通过 dOCS 光链路向外扩展。
 
据介绍,通过在OEX机架的交换板出口处部署多颗光互连光交换dOCS芯片(每颗芯片支持多路光信号交换),构建可扩展的光电融合交换网络,机架内通过电交换提供包级交换能力满足机架内灵活的业务需求,机架间通过dOCS光交换以其低时延、低功耗、物理拓扑灵活调整,为Scale-up网络提供了一个在规模、性能和灵活性兼具的网络方案。
 
因为采用了OEX设计,所以在柜内实现零线缆,单柜可达国内最高密度128卡GPU;在柜间,因为dOCS光交换,其时延低至百纳秒级,支持大规模集群。此外,该方案的拓扑能够实现动态秒级重构,灵活应对不同模型的负载。相比MEMS 等中央式 OCS 方案,曦智这个解决方案具备低成本、低延时、微秒级切换、方案故障影响范围小、硬件开放解耦等优势。


 
支持 Dragonfly部署,赋能下一代节点
 
在上述技术的推动下,行业正在打造越来越大的超节点集群,但正如不少人所说,算力的需求是无限的,短期内在超节点内集成更多卡也是一个无止境的需求。然而,在实现超10万加速卡互连的过程中会带来高带宽需求,继而迫使网络规模进一步扩大。对于传统无阻塞的胖树结构来说,将这意味着消耗数十亿美元的互连成本,这也正是行业加紧寻找高成本效益拓扑的原因之一。
 
据不完全统计,自上世纪八十年代以来,互连网络领域已提出数十种具有代表性的拓扑结构,而随着以LLM为代表的AGI的崛起,由John Kim等人于2008年首次推出的Dragonfly拓扑在近年来热度大增。
 
作为一种面向超大规模计算集群设计的新型网络拓扑,Dragonfly的核心优势在于兼顾性能、扩展性与成本效率。相比传统胖树(Fat-Tree)架构依靠多层交换机堆叠扩展网络规模,Dragonfly通过将交换节点组织成Group(组),利用组内交换机高互连能力,以及组间少量Global Link实现规模扩展,从而减少网络层级和交换跳数;在通信性能方面,Dragonfly具备较低的网络直径,可有效降低数据传输过程中的交换延迟,提升端到端通信效率,尤其适用于AI训练中的AllReduce、All-to-All等高通信负载场景。由于组间采用直连方式,相比传统三层Clos架构减少了一跳交换延迟,使通信时延一致性更优;此外,Dragonfly通过提升交换资源利用率,减少网络设备规模,在大规模集群部署中具备成本优势。
 
虽然优点众多,但和任何其他技术一样,Dragonfly的优势也需要做出一些牺牲来交换。如丢掉最短路径的多样性、性能表现更依赖均匀通信模式。面对局部热点流量时,对路由算法和流量调度能力提出了更高要求。
 
曦智科技透露,公司打造的“OEX+dOCS”架构,非常适合Dragonfly的设计需求。这也让曦智这套解决方案具备了更重要的意义。
 
依托该架构,曦智的这套方案可灵活部署 Dragonfly 全互连、环形、多集群隔离三种拓扑,实现算力拆分、任务分区调度,既可聚合多机柜资源承载超大 MoE 模型,也能拆分集群最大化利用带宽,实现多租户隔离,有效突破传统电互连瓶颈,优化集群整体 TCO,是下一代 AI 超节点重要落地路线。
 
写在最后
 
对于AI基础设施而言,未来竞争的核心已经不只是单颗芯片性能的提升,而是如何让不同计算资源形成更加高效的协同。随着模型规模持续扩大,GPU、CPU、存储以及网络之间的边界正在被重新定义,系统级架构创新的重要性也将进一步提升。
 
从这个角度来看,OCS、光电混合架构以及Dragonfly等新型网络方案的探索,并非只是对传统互连方式的优化,而是在寻找更加适应下一代AI计算需求的基础设施形态。
 
曦智科技此次推出的OEX+dOCS架构,其价值也不仅在于提供了一种新的互连方案,更在于尝试通过开放解耦的方式,让不同芯片、不同计算资源能够在统一架构下协同工作。
 
如上所述,这种思路正在成为未来超大规模AI集群建设的重要方向。
责任编辑:SemiInsights

相关文章

半导体行业观察
摩尔芯闻

热门评论