背景:计算与网络的深度耦合
在AI基础设施高速发展的当下,计算与网络的关联愈发紧密,算网协同优化已成为产业演进的必然趋势,在网计算(In-Network Computing, INC)是该方向的核心技术路径之一。
在网计算并非新兴概念,其技术雏形可追溯至HPC领域对网内归约机制的早期探索。随着AI大模型训练进入万卡级超大规模集群时代,集合通信的复杂度与吞吐压力大幅提升,在网计算技术正式进入规模化落地阶段。国际层面,英伟达是在网计算的核心推动者,其Quantum系列InfiniBand交换机内置SHARP加速引擎,实现网内聚合计算能力;博通聚焦以太网技术路线,在Tomahawk系列交换芯片中集成网内数据聚合与归约单元,构建以太网体系下的在网计算能力。
国内阿里、字节、腾讯等OTT厂商已全面布局在网计算技术,重点推进高性能集合通信库自研迭代。同时,开放数据中心委员会(ODCC)等标准化组织持续推进在网计算技术规范制定与产业生态协同。当前,在网计算已从英伟达InfiniBand体系的专属优化能力,逐步演进为兼容InfiniBand与以太网、国内外厂商共同共建的通用基础性网络能力。
一、在网计算在AI场景的收益空间
将计算算子卸载至网络设备执行,核心价值在于依托网络分布式处理能力,系统性解决传统AI集群的两大性能瓶颈:通信控制开销过高、数据传输冗余量大。
1. 卸载通信控制开销
端侧算力节省
传统架构中,端侧通信所需的数据搬运、Reduce归约及通信控制逻辑,均需占用GPU计算资源,该部分算力损耗已形成显著负载。在MoE等复杂通信场景中,通信算子的算力占用占比可达总算力的10%以上。通信任务与模型前向、反向计算抢占GPU核心资源,进一步压缩模型有效计算算力。
DeepSeek推出的DeepEP v2相较于v1版本完成关键优化,通过专用数据搬运引擎重构通信逻辑,降低通信算子对SM资源的占用,将专家并行场景下的GPU SM占用数量从24个降至4–6个,有效释放端侧计算资源。
在网计算通过在网广播与规约,大幅削减端侧数据处理压力,实现算力增益。传统集合通信模式下,各计算节点需独立完成全量数据收发与本地处理;在网计算架构可通过交换机在转发链路中直接完成数据归约聚合,并通过广播完成结果全域分发。各端侧节点仅需单次发送原始数据、单次接收聚合结果。原本分散在多节点GPU上的多轮数据搬运、重复归约与缓冲区管理逻辑,均可下沉至网络侧完成,释放的SM资源与显存带宽可全部用于模型核心计算任务。
同步优化收益
完整的集合通信流程包含前置同步、数据传输、后置同步三个阶段。前置同步通过屏障机制确保所有节点就绪后启动通信;数据传输阶段完成归约、广播或数据分发;后置同步确认所有节点通信完成,方可进入下一计算流程。
实测数据显示,在以小数据量为主的推理场景中,前后同步带来的控制时延占比极高。2机16卡集群场景下,NCCL的AG_STMC(AllGather 单线程多卡)算子存在显著的前置同步时延开销,如下所示:

DeepEP v2在256专家、topk=8的配置条件下,稀疏all-to-all通信的前置同步开销同样占据较高时延比例,如下所示:

在网计算可显著降低同步屏障带来的性能损耗。交换机可在网内统一完成数据归约与状态统计,实现通信节点的前置汇聚与后置通知,端侧无需执行显式同步屏障操作。该机制实现了通信控制全流程的网侧卸载,不仅下沉计算逻辑,同时简化整体通信控制流程。
2. 减少数据冗余传输量,提升有效带宽
集合通信场景:数据传输量降低近50%
传统AllReduce集合通信将归约与广播拆分为独立流程,数据需在端侧与网络之间多次往返传输,存在大量冗余开销。在网计算实现归约与广播的时序交叠执行,交换机在转发路径中实时完成数据聚合归约,并同步完成广播扇出,将多轮端到端传输合并为单次网内聚合分发。在不升级物理链路的前提下,可减少近50%的数据传输量,有效提升网络有效带宽。同时,该能力可拓展至稀疏通信场景,通过dispatch与combine机制适配EP并行架构,将优化收益从传统TP/DP并行延伸至MoE稀疏并行场景。
异构通信场景:有效带宽成倍提升
AI推理架构正由对称集合通信向非对称M2N异构通信演进。AF分离架构下,Attention节点与FFN节点形成非对称单边通信拓扑,传统对称通信机制无法适配该类动态异构场景。在网计算可在网络侧完成跨节点数据路由与聚合适配,大幅提升异构通信链路的有效带宽。
在Prefix Cache与RAG检索增强生成场景中,多用户请求存在上下文重叠,产生大量重复KV Cache传输开销。通过在网设备完成KV Cache的查重、聚合与复用,可彻底消除冗余传输,进一步提升推理场景的网络传输效率。
二、在网计算硬件演进方向
AI应用架构的快速迭代,对在网计算硬件能力提出了全新要求,硬件体系正朝着动态化、异步化、高并发方向升级。
1. 支持动态组播与动态聚合
传统集合通信基于静态拓扑构建,通信群组在任务启动阶段固定,运行期间无法变更。新型AI场景具备显著的动态通信特征:AF分离架构中,Attention与FFN节点的通信关系随业务请求动态切换;MoE架构中,Token路由变化将持续改变专家节点的分发目标。
这要求在网计算摆脱静态归约、静态广播的固定模式,支持运行时动态构建与销毁通信群组,实现动态归约与动态广播能力,对交换芯片的多任务实时调度能力提出更高要求。
2. 支持异步Barrier机制
现有在网计算采用同步阻塞式屏障机制,网内聚合任务未完成前,所有参与节点将处于等待状态,产生显著的RTT空闲时延。未来硬件演进将依托精细化的通信域状态管理,将同步等待逻辑完全下沉至网络侧,构建异步无阻塞屏障机制,消除同步等待带来的时延损耗,实现计算与通信流程的并行推进。
3. 支持多INC任务并发执行
AF分离推理、跨节点KV Cache共享等场景具备多任务异步并发特征,单台交换机需同时承载大量异构在网计算任务。硬件需要具备多INC任务并发调度与资源隔离能力,保障多流并行执行互不干扰,提升复杂场景下的系统吞吐与稳定性。
三、在网计算软件演进方向
硬件能力是在网计算落地的基础,标准化、可适配、可融合的软件生态是技术规模化商用的核心支撑。软件体系主要围绕端侧通信语义标准化、算子深度融合两大方向演进。
1. 完善在网计算端侧语义设计
基于硬件能力与上层框架需求,构建原子化、可扩展的新型通信语义,可实现多硬件平台的快速适配,形成网络设备与AI框架之间的标准化接口契约。
硬件原子性:动态分发、跨节点KV Cache查询、异构M2N路由等新型通信能力,可通过标准化语义组合实现,无需频繁迭代硬件逻辑。单次在网计算语义对应不可分割的完整通信操作,屏蔽交换机内部多跳运算细节,减少中间状态暴露,提升系统运行稳定性。例如在网reduce-scatter语义可将归约与分发封装为原子单元,上层仅需发起调用与接收结果,无需感知底层执行细节。
跨平台适配性:语义层可屏蔽底层硬件差异,兼容NVIDIA NVLink+NCCL、国产自研NCCL Gin后端等不同通信体系,实现统一通信算子跨平台快速适配。
2. 在网计算与融合算子深度绑定
在网计算的性能增益高度依赖算子细粒度调度优化,带宽提升与算力释放均需依托算子级协同设计,因此在网计算需与传统计算算子深度融合,而非独立外挂加速模块。
带宽增益依赖细粒度时序交叠:归约与广播、分发与合并的时序交叠,需要在网计算算子与传统通信算子实现内部时序深度耦合。软件栈需精准感知算子内部数据流向,精准划分网侧与端侧的计算边界,实现最优叠加收益。
算力增益依赖编译期资源调度:端侧算力分配对通信效率高度敏感,在网计算引入后,需结合交换芯片与GPU的算力特征,在编译阶段完成计算单元动态分配与算子融合调度,摆脱运行时被动调度的局限。
整体而言,在网计算需要深度融入计算调度全链路,通过编译期算子融合、细粒度数据流调度,实现算网一体化协同优化。
四、总结
在网计算的本质,是推动网络由被动数据传输管道,升级为具备主动计算能力的分布式计算单元。其核心收益来源于两大技术路径:通过网内归约与广播机制降低数据传输冗余,通过同步卸载与控制面下沉释放端侧有效算力。随着AI应用从传统稠密集合通信,向MoE稀疏通信、异构分离通信持续演进,集群性能瓶颈逐步由端侧算力转向网络通信能力,网络卸载与协同计算的价值持续凸显。
硬件迭代仅为技术落地的基础,在网计算规模化普及依赖标准化端侧语义体系与算子深度融合的软件生态,需要芯片厂商、网络设备厂商、框架开发者与业务方协同共建。DeepEP、Mooncake等开源技术实践已验证行业演进趋势正向“更细粒度调度、更深算子融合”持续靠拢,与在网计算技术理念高度契合。未来,随着软硬件生态持续完善,以算子卸载与融合为核心的在网计算,将成为AI基础设施的标准化能力,正式迈入“计算型网络”的全新产业阶段。










