B53 笔记(ECOC 2026 Day4 Market Focus 0923)

说明:数值均以图片核对;未看图的页仅依据 OCR 并标注”(OCR)“;看不清的写”看不清”。

0923-MF-00-上午连拍.pdf(第2–12页)

  • 讲者/机构:Yuyang Liu / China Telecom(中国电信) | 题目:Carrier-Grade Optical Networks for Distributed AI Computing – From DCI to Reliable AI Interconnect | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [1 相干/海缆/长途/DCI/AI光网络/oDSP/高波特率器件];次 [2 Scale-across/FST/多rail/ZR/ZR+/CL/跨楼园区]
  • 核心主张:
    1. AI 基础设施同时在 DCA/DCN/DCI 三域扩展(scale-up / scale-out / scale-across),网络需从”连接导向”演进为可编程、感知负载的 AI 互连。[p3, p12]
    2. 仅靠带宽不够,需容量、时延、可靠性、灵活性、智能化协同优化;DCI 沿”更高速率 + 更宽频谱”两个维度扩容。[p5, p7]
    3. 50 ms WSON 快速保护保障训练效率,并可从现有 ROADM 网络平滑演进;OCS 可从 DC 内扩展到城域,把多个光环池化。[p8, p9–11]
  • 关键数据:
    • 中国电信网络基础:31 省覆盖;系统光纤长度 500,000 km;1000+ 全光调度节点;总网络带宽 2000T+;八大算力枢纽占全国智算算力 >80%(讲者原文 “over 80% of China’s intelligent computing capacity”)。[p6]
    • 新建超低损直连光链路:G.654.E 光纤,≤0.172 dB/km;192 芯/288 芯光缆;优化路由时延约降 10%。[p6]
    • 相干速率路线:400G 已部署,~140 GBd/90 GBd,DP-QPSK/PCS-16QAM;800G 现网试验,~140 GBd,DP-PCS-16QAM;1.6T 实验室测试,200 GBd+,DP-PCS-64QAM。[p7]
    • 多频段路线:C+L 已部署,~12 THz(400G);S+C+L 现网试验,~17–20 THz(800G/1.2T/1.6T);Full band 实验测试,>37 THz。[p7]
    • 50 ms WSON 恢复时序(故障后):告警感知 100 ms→ms;路由计算 ~s→0;协议处理 s→ms;WSS 切换 s→20 ms;OTU 响应 30 ms→2 ms(Fast protocol / Fast WSS / Fast OTU 三项改进)。[p8]
    • AI 流量占比预测图:Conventional 应用流量 2023 年约 73% 降至 2033 年约 35%;AI-enhanced 应用中的 AI 流量升至约 44%(读图估计)。[p4]
    • OCS 城域应用:Type I(环,1 波长/光纤/环通道,每节点 O/E/O)与 Type II(Mesh,~M²/8 波长/光纤,每节点 ROADM 直通,M=5 示例);M=10 扩展示例。[p10, p11]
  • 提到的公司/客户/产品/标准:China Telecom ROADM 网络、WSON、G.654.E 光纤、OCS、OTN、Edge AI 机架(含可调相干收发器)。
  • 与业界对比或记录声明(SOTA/首次/record):无 record 声明;1.6T 为”实验测试”阶段,800G 为”现网试验”阶段。[p7]
  • 推荐配图页:p7(400G→1.6T 与 C+L→全频段两条扩容路线图,含波特率/调制格式/THz);p8(50 ms WSON 时序对比)

0923-MF-00-上午连拍.pdf(第13–22页)

  • 讲者/机构:Jessica Wang、Brian Smith、Jun Han 等 / Coherent | 题目:Scaling Ground Station Connectivity for Satellite Constellations | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [1 相干/海缆/长途/DCI/AI光网络/oDSP/高波特率器件](相干可插拔线路系统);次 [5 固定与无线接入 PON/FTTR/AI-FAN/RoF/FSO](卫星地面站互连)
  • 核心主张:
    1. LEO 星座持续扩张,地面站机架空间与功耗受限,需高密度、低功耗的地面站互连。[p14, p16]
    2. 用 IPoDWDM + 紧凑型可插拔线路系统(LS200)取代机箱式转发器/线路系统。[p17, p19]
    3. 线路卡 EDFA 的功能可放进 QSFP 可插拔模块;LS200 支持按需加功能、即插即用。[p20, p19]
  • 关键数据:
    • LEO 卫星数:2025 年底已超 10,000 颗;到 2030 年最多可达 70,000 颗(引用 Goldman Sachs)。[p15(OCR)]
    • LS200 vs 传统线路系统:功耗 ~20 W 对 >300 W;尺寸 1RU 对 >3RU;系统成本低对高;专为点到点链路设计。[p19]
    • LS200:10 端口(8x QSFP + 2x SFP),点到点最长 200 km,支持 100G/400G/800G/1.6T ZR/ZRx,主备路由保护(Main + Standby)。[p18(OCR), p19]
    • QSFP 可插拔 OA 与线路卡 OA 对比:最大输出功率 23 dBm 对 24.5 dBm;增益范围 328 dB 对(低增益 923 dB / 高增益 1632 dB);噪声系数 4.55 dB 对 ≤4.2 dB;波长 1528.58~1567.34 nm;功耗 11.6 W 对 65 W;尺寸 QSFP-DD A2 83x18.35x8.5 mm³ 对 220x160x20 mm³;QSFP OA 不支持 Mid-Stage 接入、可切换增益、OSC/OTDR 加/分、线圈加热、快速瞬态。[p20]
    • 可插拔模块:EDFA 双级(pre + boost),最高 23 dBm Pout/25 dB 增益;OPS 支持 1+1、1:1、BiDi、1+2、Dual 1+1;OTDR 1625 nm,动态范围 30 dB;OSC 1516/1567 nm,动态范围 46 dB,155 Mbps,230 km 46 dB 链路。[p21]
    • 现场演示:C 波段 LS200,200 km(图内标注,细节看不清)。[p22(OCR,未看图)]
  • 提到的公司/客户/产品/标准:Coherent LS200、IPoDWDM、ZR/ZRx、OTDR/OSC/OPS/EDFA 可插拔。
  • 与业界对比或记录声明(SOTA/首次/record):讲者对比传统线路系统的功耗/体积/成本优势,无 record 声明。[p19]
  • 推荐配图页:p19(LS200 与传统线路系统对比表);p20(线路卡 EDFA 与 QSFP OA 指标对比)

0923-MF-00-上午连拍.pdf(第23–38页)

  • 讲者/机构:Nathan Tracy,OIF President(TE Connectivity) | 题目:Driving a 448Gbps Signaling Spec for AI | 类型:标准(OIF 报告)
  • 方向归属(主/次):主 [3 Scale-out 224G/448G/光源/调制器/电芯片/OCS];次 [4 Scale-up/in CPO/NPO/XPO/WSE/OCS]
  • 核心主张:
    1. OIF 已按其成熟流程启动 448 Gbps/lane 电接口(CEI-448G)开发。[p38]
    2. 首批项目为 CEI-448G-VSR 与 CEI-448G-LR,2026 年 2 月启动;VSR/LR 的功耗/成本降低将带动其他变体。[p29, p31]
    3. 需权衡带宽、距离、密度、灵敏度、时延,目标是可扩展、可靠、高能效、低尾时延网络。[p38]
  • 关键数据:
    • OIF 概况:180+ 成员公司、25+ 年;1600ZR+ <1000 km 多跨相干 DWDM;1600ZR/800ZR/400ZR >80 km;1600LR/800LR <10 km;CEI 覆盖 448G/224G/112G/56G/28G;100+ 份实施协议,70+ 次互操作演示。[p24]
    • 448G 应用距离:Die-to-Die ~25 mm(XSR);Die 到光引擎(封装内)~50 mm;芯片到近端光引擎 ~150 mm;芯片到可插拔 ~250 mm(VSR);同板芯片间 ~50 cm(MR);背板/中板/线缆 ~1 m 与机箱间 ~1 m(LR)。[p29]
    • 224G 参照:VSR 主机 200 mm + 模块 20 mm、1 个连接器、1e-15 或更低(允许 FEC);LR 1000 mm、2 个连接器。[p31]
    • 当前干净信道带宽约 90 GHz,主要受连接器限制,使 448G PAM4 困难。[p33]
    • SerDes 工具箱:10G PAM-2 7 m(2007);25G PAM-2 5 m(2014);50G PAM-4 3 m(2018);100G PAM-4 2 m(2022);200G PAM-4 1–2 m(MLSD,2026 est.);400G 调制与 FEC 均标”?”(可能内 FEC)。[p34]
    • 演示测量:共封装铜(CPC)1000 mm(1 m)双轴线缆信道,约 21.9 dB @ 90 GHz(TE 提供)。[p35]
    • 448G 应用图涉及 CPC、CPO、LPO、LRO、DAC、AEC。[p30(OCR)]
  • 提到的公司/客户/产品/标准:OIF CEI-448G-FD(OIF-FD-CEI-448G-01.0,2025-11-04)、CEI-224G、TE Connectivity、CPC/NPC、IEEE 802.3、InfiniBand 等。
  • 与业界对比或记录声明(SOTA/首次/record):无 record;448G 尚处框架/项目启动阶段。[p29, p31]
  • 推荐配图页:p31(224G 到 448G 的 VSR/LR 对应关系);p34(SerDes 工具箱与每代速率/触达/技术)

0923-MF-00-上午连拍.pdf(第39–53页)

  • 讲者/机构:看不清(OIF;标题页未拍到) | 题目:OIF: Developing AI Optical Interconnect Standards on the AI Timeline(页脚标注,23 Sep 2026) | 类型:标准(OIF 报告)
  • 方向归属(主/次):主 [4 Scale-up/in CPO/NPO/XPO/WSE/OCS];次 [3 Scale-out 224G/448G/光源/调制器/电芯片/OCS]
  • 核心主张:
    1. AI 需要”AI 时间线”上的标准,同时满足应用要求并保障安全供应;MSA 快但成员受限,SDO 细致但慢。[p41(OCR)]
    2. Scale-up 功耗占机架互连功耗主导,最低功耗光互连方案将采用 CPO 或更低功耗方案。[p44]
    3. 标准面临的主要挑战是与快速变化的领域保持对齐(链路层、连接器、光链路均在演进)。[p49]
  • 关键数据:
    • 光学封装分类:FPO(前面板可插拔,~0.5–1.0 mm 间距);NPO-PCB(PCB 0.6–1.0 mm;高速接口 Flex/Cable 13–18 dB/200G,PCB 16–22 dB/200G);NPO-HDI(0.3–0.5 mm;13–18 dB/200G);CPO(C4 bump ~110 µm);CPO-AP(µbump ~30–50 µm);FPO 电接口 >22 dB/200G。[p42]
    • 72 GPU Pod(100 GBd PAM4)功耗对比:CPO 4 pJ/b、LTLR 6 pJ/b、RTLR 10 pJ/b、RTRR 15 pJ/b;Pod 总功率图中 CPO 约 90 kW 对 可插拔 约 100 kW(读图估计)。[p44]
    • Pod 配置:Scale-out 72 条光链路、800G/链路、总带宽 57.6T;Scale-up 2592 条、400G/链路、总带宽 1036.8T;scale-out 带宽约为 scale-up 的 1/10。[p44]
    • Meta 引用(ECOC25 Tu.01.03.3):CPO 交换机 >1e6 400G-port-device-hours 无不可纠码字(UCW)。[p46]
    • 方案评价维度:Radix、Shoreline Density、时延/尾时延、链路可靠性、硬件可靠性、能耗、量产、TCO、可扩展性。[p48]
    • 演进:链路层 PCIe-like(2024)→Ethernet lite(2025/6;UALink、UEC、SUE-T、ESUN);连接器 VSFF→EBO(2026);光链路 IEEE-like(DR/FR2/FR4,1310 nm)→OCI-MSA(2026;BiDi 4x50G/λ,2.5 dB,O 波段 Δf=200 GHz)。[p49]
    • OIF EEI 项目:COI 白皮书、EEI 框架、112G RTLR(完成)、224G RTLR(进行中)、高密度连接器框架、12.8 Tb/s NPO 模块项目(新,进行中;12.8 Tb/s 与 6.4 Tb/s,200G/lane;定义机械、电互连与引脚、液冷热接口、激光源、供电、光连接器)。[p51]
    • OIF 早期共封装工作:3.2T CPO 模块(Co-Packaging FD-01.0,2022-02)、ELSFP(OIF-ELSFP-01.0,2023-08,2025-01)。[p40]
  • 提到的公司/客户/产品/标准:OIF、UALink、UEC、SUE-T、ESUN、OCI-MSA、CBFC、UCIe、BoW、ELSFP、Meta。
  • 与业界对比或记录声明(SOTA/首次/record):引用 Meta CPO 可靠性结果(非本讲者数据)。[p46]
  • 推荐配图页:p42(FPO/NPO/CPO 分类对照表);p44(72 GPU Pod 各互连方案功耗)

0923-MF-00-上午连拍.pdf(第54–64页)

  • 讲者/机构:Gary Nicholl / Cisco(OIF PLL 工作组 Management 联席副主席) | 题目:Decoding OIF CMIS to Simplify Network Management for Coherent Pluggables | 类型:标准(OIF 报告)
  • 方向归属(主/次):主 [2 Scale-across/FST/多rail/ZR/ZR+/CL/跨楼园区];次 [4 Scale-up/in CPO/NPO/XPO/WSE/OCS]
  • 核心主张:
    1. CMIS 已遍及可插拔生态,是有史以来出货量最大的可插拔管理接口。[p56, p63]
    2. 增强固件管理:元数据 + 固件包实现多厂商自动化升级,与 OpenConfig 联动,向后兼容 CMIS 5.x。[p59(OCR)]
    3. CMIS 持续演进以支持最新技术与架构。[p63]
  • 关键数据:
    • CMIS 应用范围:无源/有源铜缆;多模光纤 100 m;DC 内单模 500 m 与 2 km;园区单模 10 km;户外相干 40 km→3000+ km;覆盖 400G/800G/1600G 及以上。[p56]
    • ECOC 2026 演示:CDB 50h [AppSel]、CDB 51h [InterfaceID];CMIS 5.4 模块含 Cisco-Acacia 800G ZR OSFP 与 Genuine Optics 1.6T OSFP;Wilder MSB 主机仿真;示例接口 400GAUI-4-S(Host Side,4 lane,53.1 Gbd,PAM4)及厂商自定义 Media 接口(118.5 Gbd,PCS)。[p61]
    • 固件包元数据含 VendorName、VendorPN、HW Rev、目标 FW 版本、二进制文件名、SHA-512 校验和。[p59(OCR)]
    • 展望:1.6T 模块(200G/lane,IEEE 802.3dj)、ILT 链路训练、Inner FEC、Symbol Muxing、MACsec 加密引擎管理、CMIS-sec、XPO 与 Open CPX 等新形态、CPO/NPO 管理。[p62(OCR)]
    • 演示互操作参与者含 Cisco、Genuine Optics、Wilder、Amphenol、multiLane 等(OCR 部分乱码,仅作参考)。[p60(OCR)]
  • 提到的公司/客户/产品/标准:Cisco、Acacia、Genuine Optics、Wilder Technologies(Amphenol)、OpenConfig、SFF-8024、IEEE 802.3dj。
  • 与业界对比或记录声明(SOTA/首次/record):声明为”最高出货量的可插拔管理接口”(无量化数据)。[p56]
  • 推荐配图页:p56(CMIS 覆盖从铜缆到 3000+ km 相干的应用范围);p61(ECOC26 扩展模块广告演示)

0923-MF-00-上午连拍.pdf(第65–78页)

  • 讲者/机构:Frank Chang,Sr Director, Interconnects PLM / Ciena | 题目:The Future of Coherent Optics in the AI Era | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [2 Scale-across/FST/多rail/ZR/ZR+/CL/跨楼园区];次 [1 相干/海缆/长途/DCI/AI光网络/oDSP/高波特率器件]
  • 核心主张:
    1. DCI 场景多样(Campus 10–20 km、Metro 100 km、Backbone 2,000 km+、Submarine 10,000 km+),需要不止一种相干架构;不同约束(功耗、频谱效率、部署速度、热/密度)决定不同选择。[p66, p78]
    2. 可插拔(功耗/空间优先)与性能转发器(频谱效率优先)并存;Scale-across 已到来。[p69–71]
    3. 空冷将成为光密度的约束,需液冷与 XPO;规模化时”光纤成为部署单位”,Full-Spectrum Transponder 是方向。[p72–77]
  • 关键数据:
    • 海缆(Tasman Express,2250 km,44000 ps/nm):WaveLogic 6 Nano 可插拔 23.2 Tb/s(29 x 800 Gb/s,150 GHz)对 WaveLogic 6 Extreme 27 Tb/s(+16%,27 x 1 Tb/s,162 GHz)。[p69]
    • Metro DCI:800G 可插拔(WL6 Nano)51.2 Tb/s(64 x 800 Gb/s,150 GHz)对 1.6 Tb/s 转发器(WL6 Extreme)76.8 Tb/s(+50%,48 x 1.6 Tb/s,200 GHz);演进:1600ZR、1600ZR+、1600 Coherent-Lite;转发器:网络感知、300/400 GHz 设计。[p70]
    • Scale-across 实例:数百对光纤,每对 64 x 800G(C&L 波段);WL6 Nano 800G ZR+(含互操作 PCS,C/L 版本);RLS Hyper-Rail 紧凑机箱 16 x C 与 L 波段光纤对。[p71]
    • 冷却:可插拔功耗趋势图(1600 ZR/ZR+ QSFP-DD 已逼近约 30 W 以上,读图估计);液冷供水示例 ASHRAE W4(45 °C);12.8T XPO 可液冷;直插式液冷(Direct-to-plug)无外部散热器/冷板、无干/滑动接触。[p72, p73(OCR)]
    • XPO:标准液冷 12.8T 可插拔;路由器 200T/1RU;XPO MSA;可用于 12.8T 线性驱动、12.8T Coherent-Lite、12.8T Coherent ZR。[p74(OCR)]
    • Full-Spectrum Transponder:现状每纤对 128 x 400G x 2 或 64 x 800G x 2 个可插拔;51.2T C&L 示例由 8 个 1.6T 调制解调器/服务模块 x4,经 2 个 6.4T CPO、共 16x 光纤。[p76, p77]
  • 提到的公司/客户/产品/标准:Ciena WaveLogic 6 Nano/Extreme、RLS(含 C&L 终端配置、Hyper-Rail)、XPO MSA、OSFP-RHS、OSFP Int LC、QSFP-DD800/OSFP800、ZR/ZR+/Coherent-Lite、CPO。
  • 与业界对比或记录声明(SOTA/首次/record):转发器比可插拔 Tasman Express 容量 +16%、Metro +50%(讲者对比数据)。[p69, p70]
  • 推荐配图页:p70(Metro DCI 可插拔 vs 转发器容量对比);p77(51.2T C&L 全谱转发器架构)

0923-MF-Ciena-市场聚焦.pdf

  • 讲者/机构:Frank Chang / Ciena | 题目:The Future of Coherent Optics in the AI Era | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [2 Scale-across/FST/多rail/ZR/ZR+/CL/跨楼园区];次 [1]
  • 说明:本文件为与 “0923-MF-00-上午连拍.pdf 第65–78页” 同一讲稿的另一份拍摄(第3页已被标记重复),页序略有不同(p2 DCI 场景、p4 选择因素、p5 应用重叠、p6–8 Submarine/Metro 逐步构建、p9 Scale-across、p10–12 冷却与 XPO、p14 形态演进、p15–16 全谱转发器、p17 约束总结)。内容与上一节一致,未重复看图,数据以上一节为准(p6/p7 是 p69 同一页的动画分步)。
  • 推荐配图页:p14(QSFP-DD800→OSFP800→OSFP RHS/Int LC→XPO→CPO 与全谱转发器的形态演进;仅依据 OCR 与上一节对应页)

0923-MF-Ciena-空芯光纤.pdf

  • 讲者/机构:Andrew Kam,Senior Manager, Photonic Systems Performance / Ciena | 题目:Market Focus: Hollow-Core Fiber at Scale – Operational Insights From Multi-Span Transmission Systems | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [1 相干/海缆/长途/DCI/AI光网络/oDSP/高波特率器件];次 [无]
  • 核心主张:
    1. HCF 对光性能和容量的影响可以被量化并据此工程化设计。[p15]
    2. 以现有光线路系统,HCF 已适用于区域(regional)应用。[p15]
    3. 下一步需更广泛的现网验证,理解真实路由与运行条件下的 HCF 表现。[p15]
  • 关键数据:
    • 试验历程:2020 30 km、2022 30 km(环回)、2025 110 km(单跨)、2026 400 km(多跨);累计测试 570 km、5 家不同 HCF 供应商。[p5]
    • 多跨测量:仅使用商用光线路设备,需要模场适配器(MFA)在 SMF 与 HCF 间耦合;气体吸收线(GLA)区之外 SNR 代价随光纤长度增加,与 IMI/PDL/DGD 等传播损伤一致;GLA 区内 SNR 代价随长度显著上升。[p8, p9(OCR)]
    • GLA 影响:GLA 深度随长度线性增加,逐步排除最强 GLA 附近信道;在 400 km(Metro)与 1000 km(Regional)示例中,1000 km 时”近 1/2 的 L 波段可能不可用”(讲者原话 “almost ½ of the L-band”)。[p10]
    • 非线性系数(1/W²):SMF 单跨约 10² 量级,HCF 单跨约 10⁻³~10⁻² 量级,高功率放大器约 10⁻¹,比典型放大器低 380 倍(图内标注 “380x lower than typ. amp.“);典型放大器输出 +23 dBm TOP 时放大器非线性已相关;HCF 背向散射远低于 SMF。[p11]
    • 各距离段损伤上限(DCI ≤100 km / Metro ≤400 km / Regional ≤1000 km / Long Haul ≤4000 km / Trans-Atlantic ≤10,000 km):PDL 系数 0.1 / 0.04 / 0.028 / 0.015 / 0.006 dB/√km;PMD 系数 5 / 3 / 1.6 / 0.8 / 0.5 ps/√km;NSR_IMI −50 / −55 / −55 / −56 / −59 dB/km;GLA 深度 0.1 / 0.03 / 0.01 / 0.003 / 0.001 dB/km。前提:50 ps 平均 DGD 容限;PDL 占预算 30%;占调制解调器噪声容限 5%;一条带内线引起 −25 dB NSR 代价。[p14]
    • 结论:目前没有单个样品同时满足所有随距离的目标;GLA 是长途应用中 HCF 对比 SMF 系统容量的主要限制因素。[p14]
    • HCF 损耗总体与 SMF 持平或更优。[p14]
  • 提到的公司/客户/产品/标准:Ciena、Viavi(OTDR 曲线来源)、5 家 HCF 厂商(未具名)。
  • 与业界对比或记录声明(SOTA/首次/record):无 record;现网验证长度 400 km 多跨(2026)。[p5]
  • 推荐配图页:p14(各距离段 HCF 损伤上限表,GLA 为长途主限制);p10(GLA 随距离使 L 波段可用信道减少)

0923-MF-Credo-市场聚焦.pdf

  • 讲者/机构:Rajan Pai,VP of Optical Solutions / Credo | 题目:Scaling Optical Reliability with Bandwidth Across AI Clusters | 类型:产业发布(Market Focus)
  • 方向归属(主/次):主 [3 Scale-out 224G/448G/光源/调制器/电芯片/OCS];次 [4 Scale-up/in CPO/NPO/XPO/WSE/OCS]
  • 核心主张:
    1. AI 集群规模增长使光模块可靠性成为决定性基础设施挑战;单条不稳定链路(link flap)会拖累整个同步训练。[p2, p3]
    2. 需要能预测并防止 link flap 的新型光模块健康遥测(Advanced Telemetry)。[p5]
    3. 供应商私有遥测无法规模化,需要通用接口(OCP Optics Telemetry 规范、SONiC,无需改动 SAI/YANG/DB schema)。[p11(OCR)]
  • 关键数据:
    • 规模与 flap 间隔(来源 Borrill, arXiv:2603.03736;三层 Clos,链路 MTTF 3×10⁵ h):2023 年 30 MW/20k GPU→约 3 小时;2024 年 300 MW/200k GPU→约 12 分钟;2025 年 4.5 GW/3M GPU→约 48 秒。[p2]
    • 每 GPU 约 6 个收发器;占网络成本 60%;1.6T 进入量产爬坡;单收发器 MTBF 为百万小时量级。[p2]
    • Link flap 代价:一条不稳定链路浪费 32,000 GPU-hours(32k GPU,1 小时检查点);识别故障模块前 20–30% 生产力损失;全新 100k GPU 集群假设 5 年 MTBF 约 26 分钟首次作业失败;50k GPU 的 OpenAI 训练作业中一个抖动收发器造成 25% 吞吐损失。GPU 利用率:无遥测 65–75%,优化后 >90%,约 25% 容量浪费。[p3]
    • 六类收发器:FRO 25–30 W(1.6T),DR4/FR4,遥测 Full(CMIS+CDB),可热插拔,Ramping;LPO 10–13 W,<100 m,Limited,Emerging;LRO 15–19 W,Moderate,Emerging;AOC 12–15 W,<10 m,Niche;CPO 8–9 W,Embedded,交换机级维护,2026 年占比 <1%;Near-switch/OIO ~12–16 W,遥测 TBD,开发中。[p4]
    • 遥测阈值(可编程):Post-FEC 错误 >12(立即更换);MPI >1.3(清洁连接器后仍高);Eye Height <20 mV;Pre-FEC BER 阈值(指数看不清);SNR <16 dB;Health Score 80=优/60=退化/40=严重。[p5]
    • 现场验证:两个月 ZeroFlap PILOT 集群,128 个光模块(switch-to-GPU 链路);基线(被动)vs CDB 遥测(预测);GPU 利用率基线约 60%,ZF 模块第 1 周升至约 90% 后保持,传统模块 8 周内逐步爬升至约 90%;完整数据将在 OCP ‘26 发布。[p10]
  • 提到的公司/客户/产品/标准:Credo ZeroFlap(ZF)、PILOT 遥测平台、NVIDIA SN5600 Cumulus 交换机(页面截图)、OpenAI(引用案例)、OCP、SONiC、CMIS/CDB、Borrill 论文。
  • 与业界对比或记录声明(SOTA/首次/record):宣称预测式遥测可使 GPU 利用率提前达到目标;试点规模仅 128 模块、2 个月,讲者自注为小样本。[p10]
  • 推荐配图页:p10(传统 vs ZF 模块 GPU 利用率 8 周曲线);p4(六类光模块架构对比表)

本批小结

  1. 可靠性/运维成为 AI 光互连的共同主题:Credo 用 link-flap 数据(32,000 GPU-hours、2025 年约 48 秒 flap 间隔)论证预测式遥测;OIF 认为最小化重传与 link flap 是 scale-up 关键目标并引用 Meta CPO 的 >1e6 400G-port-device-hours 无 UCW;OIF/Cisco CMIS 则通过固件自动化管理与扩展广告解决多厂商运维(Credo、OIF AI 时间线、Cisco CMIS 三讲)。
  2. Scale-up 功耗是光互连的主要驱动力:OIF 72 GPU Pod 分析显示 scale-up 链路数(2592)远多于 scale-out(72),CPO 4 pJ/b 对 RTRR 15 pJ/b;同时 448G 电通道受约 90 GHz 连接器带宽限制、CPC 1 m 铜缆在 90 GHz 约 21.9 dB,说明铜/光边界仍在博弈(OIF 448G、OIF AI 时间线两讲)。
  3. Scale-across 正落地为 800G ZR+/C&L 与中国电信式 ROADM/WSON 并行的两条路径:Ciena 给出每纤对 64 x 800G(C&L)的实例,中国电信强调 50 ms WSON 与 S+C+L/全频段(>37 THz)路线,Coherent 则以 QSFP EDFA/LS200 降低点到点线路系统功耗(~20 W 对 >300 W)(中国电信、Ciena、Coherent 三讲)。
  4. 相干可插拔的热与密度成为瓶颈:Ciena 主张液冷、直插式冷却、12.8T XPO(200T/1RU)与”光纤为部署单位”的全谱转发器(51.2T C&L 示例);Ciena 数据表明转发器在 Metro 仍比 800G 可插拔容量高 50%、海缆高 16%(Ciena 两个文件)。
  5. 空芯光纤(HCF)已进入多跨现网验证但仍有边界:Ciena 显示 400 km 多跨、570 km 累计、5 家厂商,HCF 适合区域应用;GLA 深度(0.003/0.001 dB/km 才能满足长途/跨洋)是长途容量限制,同时 HCF 非线性极低将迫使放大器重新设计(Ciena 空芯光纤一讲)。
  6. 标准化节奏是 AI 光互连的话题:OIF 指出 MSA 快而 SDO 慢,链路层/连接器/光链路(OCI-MSA、EBO、Ethernet lite)都在快速变化;OIF 同时推进 CEI-448G-VSR/LR、12.8T NPO 与 CMIS 扩展(OIF 三讲)。