从逐包调度到内存池化:智算网络的下一个五年怎么走? | 2026ODX回顾
9月4日,2026开放数据中心大会暨首届算博会(ODX)网络分论坛举行。来自腾讯、阿里云、百度、快手、中国移动、英伟达、博通、英特尔、华为、合见工软、奇异摩尔、立讯技术、远图、超会联、云脉芯联等全球智算网络头部企业的专家围绕大规模AI集群互联技术展开系统研讨。与会者的普遍共识是:当算力集群迈入十万卡乃至百万卡时代,"网络定义数据中心"已成为AI时代的核心命题,而开放标准、异构互通与端网协同,是贯穿所有技术路线的关键词。ODCC网络组组长何泽坤主持研讨。

一、端网协同新型RDMA协议:
两条技术路线同台竞技
面对AI流量"东西向、大象流、高突发、低熵"的特征,传统RoCEv2在负载均衡、拥塞控制和丢包恢复上的局限成为各家发言的共同出发点——应对之道是端网协同的逐包级重构。"在保留 ibverbs 接口的前提下,把拥塞信号、多路径、乱序接收与重传整体重做一遍"快手王正斌、腾讯郭佩圣联合汇报了 O-NET 端网协同标准协议 ORoCE 1.0 的进展。该协议由腾讯、快手、华为、曙光、中兴、云脉等十余家单位共同编写,重构了拥塞信号、多路径、乱序接收与直接数据放置、SACK选择性重传及报文扩展头五大模块。POC验证显示:EECN较基线ECN吞吐提升88%,链路异常场景提升90%~140%。按路线图ORoCE将于2027年推出参考实现与Scale-up/out融合架构原型,2028年后迈向多网融合与Agent Fabric生态。
"数据面有损、控制面无损"—这是华为唐绍飞联合任首首等分享的HyperRoCE协议最具辨识度的架构创新。其核心是逐包均衡技术体系:端侧/网侧包喷洒、防拥塞扩散、乱序接收、SACK选择性重传与消息级拥塞控制,支持M级规模、1000km扩展。实测数据亮眼:开启PCS后DeepSeek训练尾时延缩短22.5%,MCC吞吐达DCQCN的1.25倍,受害流场景通信完成时间加速92%;Write-with-Atomic等高阶组合语义还可节省1个RTT。
二、以太网Scale-Up标准化:
从协议规范走向工程落地
博通Fellow Mark Griswold 在《Ethernet Empowers the Scale-up Domain》中给出的核心判断:“决定单域XPU规模的是交换机Radix而非链路速率”。以太网已提供512 Radix并持续提升,变长报文与打包优化可将链路效率提升至92%~99%。可靠性方面,端到端重传与降lane模式两条路线正纳入UEC与ESUN规范,ESUN v1.0已于2026年2月发布。博通Tomahawk Ultra交换机以250ns时延、51.2T容量实现量产,成为首款非私有的Scale-Up交换机,且不限制任何GPU/XPU的选择。
标准要立得住,先要测得出来。阿里云郑海洋代表SONiC Scale-Up项目介绍了LLR/CBFC标准化测试的最新进展:围绕链路级重传与基于信用的流控输出22个测试用例开展测试,阿里Scale-Up交换机表现优异——全包长遍历线速零丢包,端到端时延650~710ns、抖动小于43ns。项目组计划2026年Q3发布完整测试数据集,Q4开源测试框架并建设"合规徽章"体系。
单芯片输一阵,不等于系统输一阵。合见工软杨泽重从EDA视角解读异构互联超节点的实现路径:中国智算芯片在单卡工艺与内存带宽上与北美存在差距,但凭借大规模组网能力可在系统级反超,超节点正迈向"64~1024卡、每卡4.8Tbps、内存语义跨卡直访、统一编址"的形态。合见已构建覆盖SUE/ETH-X/UALink/UCIe的完整IP生态,其多平面Scale-Up IP可将组网交换机数量从12台减至4台、端到端时延降至0.52倍。他倡议构建统一TLP语义与统一编址规则,避免私有协议阻碍异构互联。
让芯粒也变成"可换件"。奇异摩尔朱琛聚焦通用IOD的标准化:IOD作为标准化的芯粒间互联部件,让同一颗IOD无需设计变更即可适配多家XPU厂商的计算die,实现"XPU设计稳定、IOD供应商可互换"。针对KV Cache卸载场景,基于统一虚拟地址的轻量级RMA引擎可在Scale-Up域内实现接近零拷贝的KV访问。
三、NPO/CPO光互连:
铜触顶、光上位,NPO接棒可插拔
NPO以低通道损耗降低功耗,与CPO长期共存、互促生态成熟——英特尔Richard Zhang基于开放CPX架构推出2×3.2T收发NPO模组,复用成熟的1.6T IP降低风险;其异质集成InP/硅光平台已量产约10年,累计部署超4000万颗激光器。面向计算互连,OCI光计算接口实现8Tbps UCIe,为资源解耦与池化奠定基础。
"由铜到光是必然趋势,而NPO是未来几年Scale-Up光互连的产业最优解。"杨光、黄一元在《UPO定义智算光互连新范式》中给出这一演进判断:铜互连集成度逼近极限、昇腾950 SuperPoD以800G LPO实现1024卡互联、腾讯512卡NPO超节点规模部署。224G是可插拔架构的分水岭:NPO方案单模组带宽密度为可插拔4倍、单比特功耗约6pJ。UPO V1.0标准已于8月发布,以三种类型覆盖不同密度与光源方案并可向448G演进,20余家单位参与共建,拟2027年启动448G UPO标准。
光模块相关功耗占比从约90%降至20%、时延从100ns降至10ns——华为李军分享的51.2T NPO交换机实践给出了NPO最直观的收益账本:风冷架构下64×800G全端口点亮,自研51.2T交换芯片配合16颗3.2T硅光OE与可插拔外置光源。面向224G NPO,他建议OE间距小于22mm、LGA与Mezzanine两类连接器路线在OIF框架下并行探索并于2027年收敛;同时提醒448G链路可行性尚未充分论证,不应影响224G方案选择。
"能用铜就用铜,必须用光才用光"——立讯技术金龙强调光铜并进而非零和替代。面向448G,传统连接器信道带宽上限约90GHz而448G-PAM4奈奎斯特频率达112GHz,短期将以PAM6高阶调制过渡、长期回归PAM4;立讯实测OptaMax裸线带宽超110GHz、KOOLIO连接器实现超100GHz带宽,端到端链路实测满足448G要求。
"数据中心即计算机,网络定义数据中心。"英伟达冯高峰以《Networking Innovations for Gigascale AI Systems》展示了Giga-scale AI Factory的网络创新。Spectrum-X以太网实现交换机到SuperNIC的端到端处理:负载均衡带宽提升1.6倍、噪声隔离2.2倍,多租户训练性能提升42%;共封装光学(CPO)方案可将AI系统正常运行时间提升5倍。配合DSX AI Factory平台,基础设施验证周期可从6个月缩短至1周。
四、内存池化与数据面革新:
打破内存墙的两条路径
"GPU利用率很多时候受Memory限制而非FLOPS。"远图罗毅从AI内存系统演进视角剖析 CXL的定位和未来:模型权重从GPT-2的3GB增至DeepSeek V3的671GB,KV Cache成为主导性内存需求。Meta复用退役DDR4的实践证明了CXL的商业价值:硬件成本最高降低25%、推理服务器需求减少20~25%,吞吐不降反升。他梳理了"经CPU中转"与"XPU直连CXL Switch"两条池化形态,并提出"软件定义内存"定位——向上提供标准化白盒接口,向下屏蔽异构芯片差异。他判断:CXL的价值是让内存从固定配置的硬件资源转化为可分享、可调度的基础设施资源。
Decode吞吐提升5.15倍——这是腾讯张潍丰发布的IO-NET内存池超节点 最有力的样机数据:16 GPU+1TB内存池使DeepSeek-V3.2的Decode吞吐提升5.15倍。针对长上下文推理Decode性能急剧下降的问题,团队利用"连续Decode步间Top-K重叠率约80%"的发现实现冷热分级,在GPU分层内存体系中新增"L1.5 Fabric Memory"层:通过自研M(emory)Connect专用芯片将DRAM池经Scale-Up网络接入超节点,单系统最高192TB;≥32K上下文场景单卡TPS提升2.8倍。软件侧推出FMIO统一框架层,兼容SGLang/vLLM及多家国产超节点。
既然网络带宽增速远超DRAM,为什么数据还要绕道内存?华为李强提出的HiDCA(High Performance Direct Cache Access)把数据面终点从内存前移到缓存。支撑判断的三大趋势是:网络端口带宽8年增长16倍而DRAM仅3~4倍,访存争用成为系统瓶颈;云业务从容量售卖转向性能售卖;存储向片上迁移。HiDCA由两个平面构成:Scale-out侧的RDCA把数据终点从对端DRAM改为对端片上缓存,实现"绕开内存";Scale-up侧的Unified DCA统一Load/Store、消息、原子操作多种语义。技术挑战集中在缓存配额管理、安全隔离与异构缓存抽象,将按"软硬协同PoC—双平面落地—生态建设"三阶段推进。
五、超节点系统架构与AI基础设施方法论
让大模型训推从"特权"变为可标准化交付的工程能力——这是百度武正辉在《高速互联架构跃迁驱动超节点范式演进》中给出的天池超节点愿景。天池从1.0单柜32卡(33kW)迭代到3.0/4.0单柜64300kW区间、Scale-up达1024卡),供电从54V向800V HVDC演进,互联从铜缆/正交背板走向NPO全光;天池3.0采用模块化设计与多元异构池化,以"KV-Cache池化+CXL内存池"双引擎加速推理,目标是构建全国产化硬件底座。
AI集群正同时撞上通信墙、能耗墙、复杂度墙——超会联章雨雷从运营视角回答"如何构建真正可持续演进的AI基础设施"。可持续演进必须守住产出、能效、韧性、适应力四个平衡,评价体系应从单设备峰值转向"成功Token/加速器小时、焦耳/Token"等生产指标。其方案以基于SONiC的SupraNOS网络操作系统为底座,建议从"可复现基准+故障演练+版本矩阵"三件事起步。
六、网卡产业与智算网络技术演进:
迎接Agentic AI时代
网络正从"带宽型"走向"高并发、低带宽、高效率"的精细运营——云脉芯联孙伟如此概括Agentic AI对智算网络的改造:智能体多轮调用、KV Cache指数级增长与RAG非对称流量是背后的驱动。对应变革包括编程范式从GPUDirect走向GPU直驱、互联架构走向多轨多平面、传输协议引入选择性重传与Packet Trimming、QoS按业务优先级差异化调度。云脉芯联基于开放协议veRoCE的首个万卡规模集群网络正在交付,智能网卡累计交付近5万片,2027—2028年推出800G、2029年迈向1.6T。
七、趋势展望:
智算网络的下一个五年
综合各演讲者的判断,智算网络的下一个五年:
协议层——逐包调度成为共识,互通归一是关键。ORoCE、HyperRoCE等新型RDMA体系在"逐包调度、多路径、乱序接收、选择性重传、端网协同信号"上高度收敛;统一报文格式与拥塞信号语义、兼容标准verbs接口、多厂商合规认证,将决定新型协议能否从"各自最优"走向"生态共赢"。
链路层——确定性无损下沉以太网,测试认证加速落地。"LLR+CBFC链路层+ESUN/SUE传输层"的组合快速标准化,2026—2027年将是多厂商交换机、IOD、连接器方案集中收敛与互操作认证的窗口期;开源测试框架与合规徽章有望成为产业验证的基础设施。
物理层——224G是NPO规模应用主节点,铜光协同覆盖全场景。112G时代NPO已完成验证并批量部署,UPO、Open CPX等多标准并进;448G仍需连接器、调制与封装的协同突破,CPO与NPO将长期共存,持续向更高密度、更低每比特功耗演进。
资源层——KV Cache经济重塑内存体系。"热KV在HBM、温KV在Fabric Memory/CXL池、冷KV在SSD"的分层架构成为共识;2026—2027年,CXL交换芯片量产、内存语义Scale-Up网络与直达缓存数据面将相互融合,推动内存从单机资源演进为可调度的Fabric级共享资源。
整机层——超节点从"连接算力"走向"连接内存、连接Agent"。多元异构池化、液冷高密与800V供电将成为3.0代际标配,基础设施评价标准将从"建得快"转向"产得出、扛得住、演得动"。
网卡层——面向Token经济的精细运营。智能体工作负载驱动网络向"高并发、低时延、高效率"演进,网卡沿800G/1.6T、In-Net Computing与存储卸载方向迭代。
从万卡到十万卡、从连接算力到连接内存,智算网络正在经历一次全栈重构。正如多位演讲者所言:未来的竞争不是单点性能的竞争,而是开放生态、互通标准与系统级效率的竞争。网络,正在定义AI数据中心的一切。
注:本文根据2026 ODX开放数据中心大会暨首届算博会网络分论坛各演讲专家分享材料整理,数据与观点均引自各演讲者分享内容,仅代表演讲专家自身实践与判断。



