资料范围与引用口径

  • ECOC 2026 讲稿:〔ECOC 文件名简写 pN〕,pN 为现场拍摄 PDF 的页码,见 ECOC 2026 讲稿笔记。
  • OFC 2026 论文:〔OFC 论文号〕,例如〔OFC W4H.5〕。
  • 网络信源:[W1]…[W38],完整链接见文末“参考来源”。
  • 口径标注:“自报”指厂商或讲者自述;“仿真”“实验”“现网”按原文标注;“OCR”指从拍摄页识别、未逐字核对的内容。不同口径的数字不放进同一张对比表横向比较。
  • 两处前提说明:
    1. 检索范围内没有 OpenAI 收购“Onlix”的任何报道。名字最接近的是伦敦公司 OLIX,它仍独立运营,2026 年 8 月以 33 亿美元估值完成 B 轮融资。收购核实见第二章,OLIX「SRAM + 光」技术方案分析见第五章 5.5 节。
    2. “oWSE/oPSE”沿用你的 OFC 2026 论文索引中的分类,指晶圆级与 3D 光电集成(光学晶圆级引擎、晶圆级 CPO 光引擎、3D 堆叠光 I/O 等),详见第五章。

执行摘要

  1. Scale-across 的本质是“算力合并”,不是“数据合并”。 单一园区的供电(单 DC 50–300 MW,下一代训练需 1–5 GW)已经装不下一次训练,所以要把多个数据中心在逻辑上合成一个集群。北美由超大规模云厂商自建专用 AI WAN(Microsoft Fairwater),中国由国家级算力网络和运营商主导(FNTF,跨约 2,000 km 可达单 DC 98% 效率),欧洲还处在 AI Gigafactory 的选址与融资阶段。光层上,全谱转发器(FST)+ 多 rail 线路系统已经是 Ciena、Nokia、华为、中兴四家设备商的共同主推方向,Google 是共同设计方。
  2. OpenAI 没有收购光子公司,它的芯片布局是“自研推理 ASIC + 多供应商算力”。 与 Broadcom 合作的 Jalapeño 于 2026 年 6 月 24 日发布,并在 Hot Chips 2026 披露规格:单芯片 700 W、216 GiB HBM4、13.4 PFLOPS MXFP4,128 芯片本地域 + 2,048 芯片全局域。驱动力是推理成为主负载:ChatGPT 周活超过 10 亿,衡量指标变成“满足 SLA 时延下每瓦每秒请求数”。
  3. NVIDIA 投资 iPronics(2026 年 9 月 2 日,1.25 亿美元轮次)押的是 scale-up 层的光电路交换。 原因是系统带宽集中在 scale-up 层,而 OCS 能在不增加收发器与电交换机的前提下,把高带宽域扩展到机架之外。推理(尤其 LPU 流水线、MoE 解码)的流量“随部署静态”,最适合 OCS。但 NVIDIA 自己列出了插损、成本、可靠性、端口密度四道门槛,需求真正放量的时间点更可能在 2027–2028 年、与 NPO/CPO 同步。
  4. Slow & Wide 在 2026 年从“概念”变成“有 MSA、有样机、有反对者”。 OCI MSA(AMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAI)在 3 月发布 v1.0 规范(4×53.125 GBd NRZ、单纤双向)。能效优势在光引擎边界可以做到约 1 pJ/bit 以下。反方(Applied Materials 的 Chris Cole、Ciena)认为 200G/400G 串行已在量产窗口,“今天设计的慢宽到来时会过时”。决定胜负的是可靠性现场数据和反向齿轮箱的功耗。
  5. Cerebras CS-4(2026 年 8 月 18 日发布)用“三晶圆一机架”解决了 CS-3 单晶圆的容量与供电瓶颈,但内存容量问题要到 CS-6(3D 叠层 DRAM)才会根本改变。 晶圆间互连目前仍是电学的(每晶圆 2.4 Tb/s)。Cerebras 在 ECOC 上把“光学晶圆 + WSE + DRAM 三层混合键合”列为方向,但没有给出数值。光子晶圆级阵营的其他玩家:Lightmatter(Passage M1000,114 Tbps)、Marvell(已完成收购 Celestial AI)、台积电(SoW-X 规划到 2029 年)、imec(300 mm 光罩拼接 SiN 波导)。同属“SRAM 放模型”推理路线的 OLIX 用自研慢宽光互连连接大量芯片,2027 年交付,与 NVIDIA Groq 3 LPX、Cerebras CS-5 正面竞争(见 5.5)。

一、Scale Across:为什么要“合并数据中心”,业界怎么连

1.1 先回答前提:是“数据合并”带来的变化吗?

不是。从证据看,驱动力是算力无法在单一站点容纳,而不是数据的汇聚。

  • 供电上限:单 DC 电力 50–300 MW(引 Microsoft OFC 2026 Workshop),下一代 LLM 训练需约 1–5 GW;Google(俄亥俄 + 爱荷华,4 个 DC,80 km)与 NVIDIA(3 个 DC,40 km)已有多站点规划〔ECOC 0923-We5-B-中兴 p4〕。KDDI 在 OFC 上把供电、散热与空间列为单一数据中心无法承载 AI 基础设施的三个原因〔OFC W4H.3〕。
  • 规模数量级:Nokia 统计每个 AI 园区有 4–12 栋楼,园区间距 2–40 km,并称“园区光纤数量已成危机”〔ECOC 0920-Su3Su4-A 全场扫描 p111〕。Ciena 与华为把 scale-across 的系统规模定为:传统 DCI 约 200 Tb/s → scale-across 超过 10 Pb/s,扩容粒度从“每波长”变成“每光纤对”,rail 数从约 10 条到 100 条以上〔ECOC 0920-am-Su2-B-02-Ciena p10〕〔ECOC 0920-pm-Su4-C-03-华为 p5〕。
  • 流量预测:Cignal AI 预测 scale-across 占云可插拔带宽的比例从 2025 年的 5% 升到 2030 年的 72%,2028 年超过城域/前端 DCI;2030 年 scale-across 支出 87 亿美元,其中线路系统占 55%(预测)〔ECOC 0922-MF-am-1140-CignalAI p7–p9〕。Cisco 引用的相对增速:scale-across(1M+ GPU)14 倍,前端 DCI 7 倍〔ECOC 主分析师笔记04-Marvell p3〕。

所以更准确的说法是:把多个数据中心“合并”成一台逻辑上的超级计算机。Microsoft 把它称为“AI superfactory”[W1],NVIDIA 称为“giga-scale AI super-factories”[W3]。

1.2 北美、欧洲、中国:主流厂家怎么建

区域代表项目建设方式规模与关键数字来源
北美Microsoft Fairwater(威斯康星 + 亚特兰大)超大规模云自建园区 + 专用 AI WAN,把两个站点当作一个“AI superfactory”每机架最多 72 颗 Blackwell GPU,约 140 kW/机架、1,360 kW/排;两层以太网后端,GPU 间 800 Gbps;过去一年新增超过 12 万英里光纤;亚特兰大站点“以 3 个 9 的成本达到 4 个 9 的可用性”,不配置现场发电和 UPS[W1][W2]
北美OpenAI Stargate 等与 Oracle、SoftBank 合资,约 10 GW / 4 年,同时向 NVIDIA(≥10 GW 意向)、AMD(最多 6 GW MI450,2026 年下半年先上 1 GW)、Broadcom(10 GW 自研加速器)、Cerebras(750 MW)多方采购见第二章[W12][W13][W14]
北美Google多 rail 线路系统(HyperRail)与多站点训练;TPU 集群长期使用 OCS每站单个 ILA 机房,功耗下降约 80%(自报)〔ECOC 0920-am-Su2-B-01-Google p5〕
欧洲EU AI Gigafactories(InvestAI)公共 + 私人资本,单站点 10 万颗以上先进 AI 芯片InvestAI 计划撬动 2,000 亿欧元,其中 200 亿欧元用于 AI gigafactory;因各国申报踊跃,名额从 4–5 个扩到 7 个;76 个联合体表达意向;征集 2026 年 11 月 12 日截止,2027 年初定点[W6]
欧洲OVHcloud区域 Fabric 环,“一组区域共享一套服务栈”<10 km 用长距可插拔直连;>10 km 用 800G ZR/ZR+ 加线路系统,跨段约 100 km〔ECOC 0920-am-Su1-C-00 p14–p16〕
欧洲BT运营商视角:AI 流量在消费者流量中尚不明显核心流量超过 34 Tbit/s;推理约“一个波长”的量级,现有 ROADM 即可承载;训练需要 scale-across,形态是“光纤岛”〔ECOC 0920-am-Su1-C-00 p19–p26〕
中国未来网络试验设施 FNTF(东数西算骨干)国家级确定性网络,把分散的数据中心组成算力池2025 年 12 月 3 日投运;跨约 1,243 英里(约 2,000 km),40 个城市、约 34,175 英里光传输线路;效率达单一数据中心的 98%;50 Gbps 确定性通道[W7][W8]
中国中国电信运营商主导的跨城 DCI + OCS 城域池化最多 3 个跨城 DC、1,024 GPU,训练效率超过 97%;WSON 恢复 <50 ms、最长路由 640 km;G.654.E 光纤 ≤0.172 dB/km〔ECOC 0923-We-F-00 标准化专场II p31〕〔ECOC 0923-MF 连拍 p6–p8〕
中国中兴 + 长飞设备商 + 光纤商联合现场试验600 km 长途跨 AIDC,1,024 GPU 训练 LLaMA2-70B,DP 效率损失 <5%、PP <1%〔OFC W4H.5〕
中国阿里云 + 中国电信运营商拥有设施、云厂商提供服务2026 年 4 月韶关智算中心上线,1 万张平头哥“真武”国产 AI 卡[W9]

三种模式的差别很清楚:

  • 北美:云厂商把“算力 + 光纤 + 网络芯片”纵向整合。
  • 中国:国家确定性网络与运营商 OTN/OCS 承担跨域连接,同时受国产芯片单点规模的约束,更需要把多个中等规模集群合起来。
  • 欧洲:瓶颈在资本与选址,技术上多数复用运营商的现有光网络。

1.3 训练与推理为什么都有“合并”需求,但程度不同

训练:数据并行(DP)的梯度同步是跨站点流量的主体,但在合理切分下带宽需求可控。中兴在 OFC 的现场试验里给出了完整计算〔OFC W4H.5〕:

  • 切分方式:LLaMA2-70B,1,024 GPU,PP=8、TP=8、DP=16。每次 DP 通信每 GPU 约 4.37 GB。
  • 带宽需求:要让通信时间只占 1%–5%,线路侧需要 3.2–16 Tb/s。
  • 实际配置:取 1:8 收敛后为 12.8 Tb/s,由 16 个 800G 相干模块承载(135 GBaud PCS-16QAM,OTN)。
  • 效果:跨 600 km,DP 效率损失 <5%,PP 损失 <1%。

这说明只要把张量并行留在站内、只让 DP/PP 跨站,几百公里是可行的。

距离敏感度取决于 GPU 代际。Corning 在 ASTRA-sim 上仿真 GPT-3 175B、8,192 GPU〔ECOC 0924-Th1-G1-Corning p6–p10〕:

  • 10 km 以内计算与通信几乎完全重叠。
  • H100 在约 10–30 km 起开始下降,A100 要到约 100 km 以上。
  • DC 间距 1,000 km 时,训练时间相对 0.3 km 基线:H100 约 26 倍,A100 约 4 倍。
  • 空芯光纤能把 H100 的 26 倍惩罚降到约 17 倍(仿真)。

结论是:GPU 越快,对跨站时延越敏感,这正是空芯光纤在 scale-across 中的价值所在。

KDDI 的测试床从另一侧验证了这一点〔ECOC 0922-Tu1-G1-KDDI p7–p10〕〔OFC W4H.3〕:

  • RDMA 时延 = 14.514 + 9.836·x µs(x 为公里数)。
  • 在 0、20、30 km 下,All-to-All/All-Reduce 的作业完成时间几乎无差异。
  • 4 个集群各相距 30 km 互连,作业完成时间与单数据中心等规模集群相当。

推理:跨站需求来自三点:

  1. 资源池化与容量利用:华为的实网测试把模型首末层放在本地卡、中间层放在云端,部分场景算力效率损失 <5%〔ECOC 0920-pm-Su4-C-03-华为 p7〕。
  2. 分离式推理(prefill/decode 分离)需要“高容量、零丢包”连接:Telefónica 认为部分 AI 用例只有拥有边缘算力的运营商才能提供〔ECOC 0920-am-Su1-I-01+02-Telefonica p9, p14,OCR〕。
  3. Microsoft 的判断:“训练已从单一的整体作业演变为多种不同需求的负载”[W2]。

不过推理的跨站带宽远小于训练。BT 的估计是推理约“一个波长”的量级〔ECOC 0920-am-Su1-C-00 p25〕。因此 scale-across 的光层规模主要由训练决定,推理决定的是时延与可靠性要求。

1.4 业界 Scale-across 的网络互联方案与架构

可以分四层来看:

层方案代表产品与关键规格来源
交换/路由(L2/L3)跨站以太网 + 深缓冲 + 长距拥塞控制NVIDIA Spectrum-XGS(2025 年 8 月 22 日,Hot Chips 2025):随距离自动调整的拥塞控制、精确时延管理、端到端遥测;Broadcom Jericho4:3 nm,51.2 Tb/s,HBM 包缓冲(比片上缓冲多 160 倍),支持 100 km 以上 RoCE,3.2T HyperPort(4×800GE 合成 1 个逻辑端口),单系统最多 36,000 个 HyperPort;Cisco 8223 / Silicon One P200:3RU、64×800GE、51.2T,支持最远 1,000 km 的相干链路[W3][W4][W5]
协议/代理在 DCI 边缘做 RDMA 代理华为 OTN-Proxy:支持 >100 Tb/s,带代理时吞吐与 DCI 距离基本无关(曲线数值看不清,OCR);KDDI OCS 网关:ZR 直连 scale-up 交换机,实现 RDMA-over-WDM,相邻集群最远 80 km〔ECOC 0920-pm-Su4-C-03-华为 p6〕〔OFC W4H.3〕
光模块按距离分档Marvell:>10 km 用 1.6T ZR/ZR+,2–10 km 用 O 波段 Coherent-Lite 1.6T/3.2T;Nokia:1600ZR 约 236 GBd 单载波(约 2026 年第二季度完成互操作),1600ZR+ 为 2×约 126 GBd、最远约 1,000 km(约 2026 年第三季度);园区 FEC 时延须控制在 50–75 ns;800ZRx 全球出货已超过 10 万端口(2026 年第二季度,Cignal,OCR)〔ECOC 0920-pm-Su4-A-01-Marvell p5〕〔ECOC 0920-pm-Su4-A-04-Nokia p12–p13〕〔ECOC 0922-MF-am-1140-CignalAI p10〕
线路系统 / 光纤FST + 多 rail、C+L/S 波段、空芯光纤见 1.5;Azure:在空芯光纤上用 400G ZR 跑全 C 波段 3 跨 427.97 km(记录);中国电信:S+C+L 现网试验约 17–20 THz〔ECOC 0922-Tu3-H4-Azure p12–p13〕〔ECOC 0923-MF 连拍 p7〕

学术界还有一条“低功耗相干”路线:北京大学与上海交大的 PDP 论文用电光梳共享载波与时钟,做出 18λ×384 Gb/s 超信道,采样抖动 <0.9 ps,从而可以做“波特率采样”的 Coherent-Lite 接收,1 小时内长期 SNR 代价仅 0.12 dB,明确面向跨区 AIDC 分布式训练〔OFC Th4C.8〕。

1.5 FST 与 Multi-Rail:是否主推,谁在做,优势与挑战

结论:是主推方向。 四家设备商都已有产品,且都把“以光纤对为交付单位”作为 scale-across 的核心叙事。Google 以共同设计方身份在推动。Cignal 的数据(线路系统支出占比从 2025 年的 32% 升到 2030 年的 55%)说明成本重心正在从模块转向线路系统〔ECOC 0922-MF-am-1140-CignalAI p8〕,FST 与多 rail 正是针对线路系统做的集成。

厂商方案关键规格(均为自报)时间来源
Ciena全谱转发器(WaveLogic 6 1.6T)+ RLS HyperRail(第二代 RLS,与超大规模云共同设计)16 对光纤场景:被管设备 192→32(-84%)、机架单元约 -75%、功耗约 -50%;每机架从 4 条 rail 增到 128 条,EDFA 密度 32 倍;每对光纤从 60–120 个插件变成 1 个线路端口;传统需 22 个机房,多 rail 只需 1 个OFC 2026 发布;2026 年底前完成首批客户标准化,2027 年开始放量〔ECOC 0920-pm-Su4-C-04-Ciena p3–p4〕〔ECOC 0920-am-Su2-B-02-Ciena p8〕[W10]
Nokia1830 GX Multi-rail OLS1RU 支持 4 条 rail,40RU 机架最多 160 条;ILA 密度是传统方案的 40 倍、当前先进方案的 8 倍;每条 rail 功耗降低 60% 以上2026 年下半年供货[W11]
华为FST + 4-Rail OA单系统每纤 25.6T(C96),C96+L96 时 51.2T;4-Rail OA 在 1U 内集成度提高 75%,达到单 rail 级可靠性已在 ECOC 发布〔ECOC 0920-pm-Su4-C-03-华为 p5〕
中兴FST + OMC 架构的 DCI-BOX;19.1 THz S+C+L 800G CFP2节省光纤 74.8%(讲者原文);DSP 137 GBd产品方向〔ECOC 0923-We5-B-中兴 p10–p15〕
Google(客户)HyperRail每站单个 ILA 机房,功耗约 -80%;从 4 条 rail 扩到 8 条及以上部署中〔ECOC 0920-am-Su2-B-01-Google p5〕

核心优势:

  1. 可管理对象数量下降一个数量级:FST 把“每光纤对 60–120 个插件”变成 1 个线路端口〔Ciena p8〕。
  2. 站点与功耗:多个放大器共用泵浦、无制冷多芯片泵浦,每 rail 功耗降 60% 以上(Nokia)、单站功耗降约 80%(Google)。
  3. 频谱效率:Ciena 称,在城域 DCI 中,转发器方案(48×1.6T、200 GHz,共 76.8 Tb/s)比可插拔方案(64×800G、150 GHz,共 51.2 Tb/s)多 50% 容量〔ECOC 0923-MF 连拍 p70〕。

挑战:

  1. 站点电力与泵浦供给变成新规格:Ciena 下一代 X-Large ILA 机房站点功率 400 kW,每站最多 20,736 条 EDFA rail、最高 4 MW / 5,000 A 供电〔ECOC 0920-pm-Su4-C-04-Ciena p2〕。
  2. 与可插拔的边界之争:Google 主张用可插拔闭合链路、追求“够用的 SNR”,Ciena 自己也同时出货 WL6 Nano 可插拔,二者其实是按场景切分〔ECOC 0923-MF 连拍 p69–p71〕。
  3. 供应链:线路系统部件交期 12–18 个月,产能受 InP 晶圆限制〔CignalAI p9,OCR〕。
  4. 术语歧义:NVIDIA Spectrum-X 的“多平面多 rail”是 scale-out 的交换拓扑(8 平面、4 rail,交换机数量省 1.7 倍),与线路系统的多 rail 是两回事〔ECOC 0921-MF-pm-1340-NVIDIA p9–p10〕,引用时要区分。

1.6 本章判断

  1. Scale-across 的光层在 2026–2027 年会以“FST + 多 rail + 1.6T ZR/ZR+”为主干,空芯光纤在时延敏感的站点间做选择性部署。领纤自报空芯光纤价格超过 3,000–5,000 美元/km(SMF 为 20–40 美元/km),累计产量约 83 km〔ECOC 0921-Mo3-B1-领纤 p13, p60〕。
  2. 中国路线的特点是“OTN/OCS + 确定性网络”,北美路线是“以太网深缓冲 + 专用光纤”,两者在光层会趋同,在协议层会长期并存。
  3. 要盯的指标:各家 multi-rail 的首批客户标准化时间(Ciena 2026 年底)、1600ZR/ZR+ 互操作进度(2026 年第二、三季度)、跨站训练的效率损失能否稳定在 5% 以内(中兴、中国电信、FNTF 已给出 97%–98% 的效率数据)。

二、OpenAI:不是收购,而是“自研推理芯片 + 多供应商算力”

2.1 事实更正:OpenAI 没有收购 OLIX

  • 伦敦初创公司 OLIX Computing 于 2026 年 2 月融资 2.2 亿美元(估值约 10 亿美元),8 月 4 日完成 3.12 亿美元 B 轮,投后估值 33 亿美元,仍是独立公司[W15][W16]。
  • 它的首款推理芯片 DX-1 计划 2027 年下半年推出,架构正是本文第四章讨论的“slow and wide”光互连[W16]。有报道称 DX-1 对 1,000 亿参数模型可达每用户每秒 1 万 token 以上,且不需要 HBM[W40](该数字来自二手报道,建议以官方资料为准)。
  • OpenAI 2025–2026 年公开的收购里,硬件方向只有 io(Jony Ive 的设备公司,65 亿美元)和相机算法公司 Glass Imaging(2026 年 9 月,超过 3 亿美元),没有芯片或光子公司[W17][W18]。
  • 与 OLIX 最接近的交集,是 OpenAI 作为创始成员参与的 OCI MSA:光学 scale-up 的开放规范[W19]。

2.2 OpenAI 的芯片布局(截至 2026 年 9 月)

项目内容来源
与 Broadcom 合作2025 年 10 月宣布共同设计并部署 10 GW 自研加速器 + 以太网系统,2026 年下半年开始,2029 年底完成;Mizuho 估计代号“Titan”的整体交易价值 1,500–2,000 亿美元(分析师估计)[W13]
首颗芯片 Jalapeño2026 年 6 月 24 日发布,定位推理[W20]
Jalapeño 规格(Hot Chips 2026)13.4 PFLOPS MXFP4,216 GiB HBM4、15.4 TB/s,封装功耗 700 W;scale-up 带宽:128 芯片本地域 600 GB/s、2,048 芯片全局域 200 GB/s;2,048 芯片系统共 27 EFLOPS、432 TiB 内存;用 Broadcom Tomahawk 6 组成“半扁平化”两级 Clos[W21] 〔ECOC 0920-pm-Su4-I-02-OpenAI p5–p6〕
开发节奏2024 年底定架构 → 2025 年 RTL 冻结 → 2025 年底流片 → 2026 年初开始跑 Codex,随后接入 ChatGPT;用 AI 优化的内核比专家手写快 1.5–1.8 倍[W21]
性能对比gpt-oss-120B 上,Jalapeño(700 W)对比 GB200(1.2 kW):每千瓦混合 token 吞吐高 1.9 倍,端到端时延低约 1.7 倍;DeepSeek R1 670B 上:吞吐高 1.7 倍,时延低 3.6 倍;ECOC 讲稿中对比 GB300 MTP:最小端到端请求时延 1.65 s 对 3.69 s,解码可达约 700 tokens/s/用户[W21] 〔ECOC 0920-pm-Su3-A-02-OpenAI p7–p8〕
多供应商算力NVIDIA ≥10 GW 意向(NVIDIA 随部署最多投资 1,000 亿美元);AMD 最多 6 GW MI450(2026 年下半年先上 1 GW);Cerebras 750 MW(Cerebras 称价值超过 200 亿美元,另有到 2030 年追加 1.25 GW 的期权)[W41][W12][W14]

2.3 需求变化:为什么现在做芯片

  1. 推理成为主负载:ECOC 讲稿引用 ChatGPT 周活从 7 亿(2025 年 9 月 15 日)→ 9 亿以上(2026 年 2 月 27 日)→ 10 亿以上(2026 年 8 月 31 日);Codex 周活从 160 万 → 500 万以上(2026 年 7 月 9 日)〔ECOC 0920-pm-Su4-I-02-OpenAI p3〕。TechCrunch 报道 OpenAI 的分工是:算力更密集的预训练仍主要用 NVIDIA,自研芯片瞄准推理成本[W20]。
  2. 一个请求被拆成三种硬件形态:Prefill(算力重、通信平滑)、Draft 模型(小模型、超低批量、受时延限制)、Spec-verify/Decode(受 HBM 带宽限制,MoE 通信突发)。核心指标是“满足 SLA 时延下每瓦每秒请求数”〔ECOC 0920-pm-Su4-I-02-OpenAI p4〕。通用 GPU 很难同时优化这三种形态,这是自研 ASIC 与引入 Cerebras 晶圆级推理的共同原因。
  3. 互连成为可靠性问题:OpenAI 在 ECOC 的三场报告都强调“恢复时间是交付性能的一部分”,要求用 FIT 置信上界公式评估链路〔ECOC 0920-pm-Su3-A-02-OpenAI p10〕〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p10〕。

2.4 OpenAI 在光互连上的实际动作

  • 今天用铜:Jalapeño 机架内是铜背板,每机架 128 颗 ASIC(16 托盘 × 8)〔ECOC 0920-am-Su1-B-02-OpenAI p7〕。
  • 路线选择的顺序:先用铜(看链路预算)→ 铜不够时用快窄可插拔 → 短距 GPU 链路可用带冗余路径的慢宽,但“需要可靠性证明”〔ECOC 0920-pm-Su4-I-02-OpenAI p8〕。
  • 用系统结果做比较:比较铜、可插拔、NPO、CPO 时看请求时延与每请求能耗,而不是单看链路指标〔ECOC 0920-pm-Su3-A-02-OpenAI p10〕。
  • 参与标准:作为 OCI MSA 创始成员,推动 4λ×53.125 GBd NRZ 单纤双向的 200G 接口,但在 ECOC 上明确表示“需要进一步做故障与恢复分析”〔ECOC 0920-pm-Su4-I-02-OpenAI p13–p14〕[W19]。

判断:OpenAI 的策略是“掌握负载定义权 + 分散供应”,不是垂直收购光子公司。它对光互连的影响力来自两处:Jalapeño 与 Titan 的采购规模(10 GW),以及 OCI MSA 的规范话语权。光子初创公司(包括 OLIX)更可能成为它的供应商或 MSA 生态成员,而不是被收购对象。这一点需要跟踪 2027 年 OLIX DX-1 的客户名单来验证。


三、NVIDIA 投资 iPronics:Scale-up 为什么要用 OCS

3.1 事件

  • 投资:2026 年 9 月 2 日,NVIDIA 与 Maverick Silicon、Light Street Capital 共同出资 1.25 亿美元,支持 iPronics 第二代硅光 OCS,iPronics 累计融资 1.77 亿美元[W22][W23]。iPronics 于 2019 年从瓦伦西亚理工大学分拆。
  • 产品现状:当前芯片 32 端口,72 端口和 144 端口版本在研;目标每机架单元最多 720 个端口对[W22]。
  • 放在 NVIDIA 光学投资序列里看:2026 年 3 月 2 日分别投资 Coherent 和 Lumentum 各 20 亿美元,3 月 31 日投资 Marvell 20 亿美元[W24][W25]。iPronics 这笔是其中唯一一家 OCS 专业公司。

3.2 为什么在 Scale-up 用 OCS:NVIDIA 自己的论述

NVIDIA 研究团队(Bakopoulos、Mentovich、Lapukhov 等)在 OFC 2026 的邀请论文中,把 OCS 的插入点分为 scale-across、scale-out、DPU 和 scale-up 四层,并明确写道:“系统的大部分带宽集中在 scale-up 层,这里引入 OCS 最难,但影响最大;它可以在不增加收发器和电交换机全部成本的前提下,把高带宽域扩展到多个机架,并形成更大的资源池”〔OFC M3F.6〕。

具体动因:

  1. 带宽集中:GPU 带宽每两年翻倍(2.4 → 3.6 → 7.2 Tb/s),GPU 域 8 → 72 → 数百颗,机架功率 25 kW → 150 kW → 1 MW;GPU 到一级交换的距离从 0.5 m 扩到最长约 30 m,“铜到达极限”〔ECOC 0920-am-Su2-I-01-NVIDIA p8〕。
  2. 减少光电转换次数:iPronics 比较了三种 scale-up 拓扑,功耗从高到低依次是:机架内 EPS+CPO 加机架间 OCS、扁平 EPS、扁平 OCS。电交换机的功耗随代际升到 64×1600G 约 3,500 W,iPronics 系统约 30 W + 0.78 W/激活通道〔ECOC 0920-am-Su2-I-03-iPronics p3, p13〕。
  3. 把故障变成重路由:NVIDIA 在 ECOC 提出“用 OCS 重构把故障变成重路由”〔ECOC 0920-am-Su2-I-01-NVIDIA p10, p20〕;OFC 论文还提出可以用 OCS 纠正布线错误、加快大系统上线〔OFC M3F.6〕。
  4. 推理产品线的新需求:NVIDIA 通过 200 亿美元的 Groq 授权与人才交易推出 Groq 3 LPU。单芯片 500 MB SRAM,每个 LPX 机架 256 颗;由 LPU 做 decode、Rubin GPU 做 prefill[W26]。The Register 在报道 iPronics 投资时指出,OCS 最适合“网络路径不常变化”的场景,例如 LPU 集群的流水线并行[W22]。

3.3 训练与推理中的使用场景

场景流量特征OCS 的作用证据
训练:按作业重构拓扑每个作业的并行切分固定,作业间变化按作业把机架组合成 torus 或其他拓扑,跳过故障节点Google TPU 长期使用 OCS[W22];TPU 8t 单超级 Pod 9,600 芯片(3D torus)[W27]
训练:故障韧性大集群单点故障频繁备用路径切换,恢复时间计入交付性能〔OFC M3F.6〕〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p10〕
推理:MoE/专家并行按模型部署(以及 SLO)静态配置,“推理框架掌握路由分配需要的全部信息”一次配置、长期使用,不需要微秒级切换Salience Labs:scale-up 交换“随负载静态”〔ECOC 0922-PF-1155-SalienceLabs p16〕
推理:高交互 decode低批量、通信处在关键路径上省掉电交换一跳:单级 EPS 事务 1,000 ns、两级 1,600 ns,其中带宽贡献仅 25 ns〔SalienceLabs p5–p6〕;512 XPU All-reduce 中,EPS 完成时间比 OCS 多约 58%–61%(读图)〔SalienceLabs p10〕
推理:TPU 8iMoE 推理Boardfly:4 芯片 → 32 芯片组(铜)→ 36 组经 OCS 连成最多 1,024 颗活动芯片的 Pod,最坏跳数从 16 降到 7[W27]
推理:LPU 流水线数据逐芯片流过,路径固定用 OCS 连大规模 LPU 集群[W22][W26]

3.4 NVIDIA 和产业链怎么考虑

  • NVIDIA 列出的四道门槛〔ECOC 0920-am-Su2-I-01-NVIDIA p18〕:
    1. 插损:当前路径至少经过 4 个面板连接器,DR4 只有 3 dB 余量,FR4 只有 4 dB。
    2. 成本:目标每 1RU 超过 256 个双工端口。
    3. 可靠性:不能劣化 BER/FEC 余量。
    4. 端口密度:每个机架需要上千个 OCS 端口。
  • OFC 论文补充了取舍:WDM 可以提高 OCS 的有效端口数但会增加插损;双向传输在某些配置下会限制任意到任意的连接;固态集成 OCS 的插损更高,可能需要片上放大,从而增加复杂度、功耗与光损伤〔OFC M3F.6〕。
  • iPronics 的回应:用硅光加 SOA 增益补偿损耗(增益 8–12 dB),与 Lumentum 1.6T 2×DR4 收发器联测,前置 BER 相对 1e-12 基线只劣化 1 个数量级(自称“业界首个”);切换时间 300 ps(器件级),系统重构为亚毫秒级;宣称比现有方案紧凑 20 倍、成本效益高 3–5 倍、约 100 美元/端口(自报)〔ECOC 0920-am-Su2-I-03-iPronics p11–p12〕〔ECOC 0921-Mo3-A1-iPronics p1, p14〕〔ECOC 0924-推定F4-iPronics p4, p21〕。
  • 竞争格局:
    • MEMS/3D 自由空间方案多为每 1U 32–40 端口,供应商包括 Coherent、Lumentum、Polatis、光迅/Triple-Stone(320×320)、Molex 等〔ECOC 0921-Mo3-A1-iPronics p2〕。The Register 称 Coherent 的 300 端口设备需要 8U 以上[W22]。
    • 硅光与超快路线:Oriole Networks 宣称瓶颈在收发器的再锁定时间,其方案在 32,000 GPU 集群中把收发器总数从 196,608 个降到 32,768 个、网络功耗降 81%(自报)〔ECOC 0920-pm-Su3-A-04-OrioleNetworks p9, p12〕;Salience Labs 主攻 scale-up OCS。

3.5 需求真的会来吗

支持放量的证据:

  1. NVIDIA 已把 OCS 写进系统架构:OFC M3F.6 给出四层插入点,并投资专业 OCS 公司。
  2. Google 已有推理用 OCS 的产品:TPU 8i 的 Boardfly 拓扑。
  3. 推理负载有利于 OCS:Salience 与 The Register 都指出推理流量随部署静态,天然适合电路交换。
  4. scale-up 带宽与机架功率的增长让电交换机成为功耗与成本的大头。

制约因素:

  1. 硅光 OCS 的插损要靠 SOA 补,在大规模下的可靠性与 FIT 数据还没有公开。
  2. Salience 自己标注:全 OCS 的 scale-up 架构“需要 NPO/CPO”,带光链路的纯 EPS scale-up 交换要到 2027 年〔SalienceLabs p7〕。也就是说,scale-up OCS 的前提是 scale-up 先光学化。
  3. 软件栈(编排器、NCCL、SDN 控制器)还在开发中〔iPronics p3〕。

判断:

  • 2026–2027 年:OCS 先在推理集群(LPU、TPU 8i 类)和“机架间扩展 scale-up 域”中试点,规模是数百到数千端口。
  • 2027–2028 年:随着 NPO/CPO 进入 scale-up,扁平 OCS 拓扑具备条件,硅光 OCS 的端口数(iPronics 计划 2027 年推出 100 端口以上的芯片〔ECOC 0921-Mo3-A1-iPronics p10〕)和 SOA 可靠性是放量的前提。
  • 需求会来,但它跟着 scale-up 光学化走,而不是跑在前面。

四、Slow & Wide:2026 年的风向、方案、优势与挑战

4.1 风向:从概念到有标准、有样机、有反对者

  • 标准层面:2026 年 3 月,AMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAI 成立 OCI MSA,3 月 11 日发布 200G OCI 线路接口规范 v1.0:一路 212.5 Gb/s 电信号映射为 4 个 53.125 GBd NRZ 光通道,用级联微环实现 DWDM,单纤双向(收发走不同波长组)[W19][W28]。LightCounting 统计 2026 年共有 6 个 MSA 在“囤积可互操作的选项”(XPO、CPX、400G Optics、OCI、SDM4 MCF、Expanded Beam),其中只有 OCI 是慢宽路线〔ECOC 0920-pm-Su3-I-02-LightCounting p9, p12〕。
  • 会议层面:ECOC 2026 专门设了“Fast/Narrow or Slow/Wide?”Workshop,没有一家声称慢宽全胜。
    • 押快窄:Applied Materials 的 Chris Cole 称“快窄是 400G 光学唯一现实的选项,慢宽是适合吸引 AI 融资的未来技术”〔ECOC 0920-pm-Su3-I-08-AppliedMaterials p12〕;Ciena 认为“动量仍在通道速率上,快窄仍是规模化的最短路径”〔ECOC 0920-pm-Su3-I-05-Ciena p10〕。
    • 押慢宽:Lightmatter 称“快窄有天花板,慢宽没有——在 3D 时”〔ECOC 0920-pm-Su4-I-06-LightMatter p3, p15〕;Credo 自称唯一做完整宽并行光学栈的厂商〔ECOC 0920-pm-Su4-I-07-Credo p8〕。
    • 中间派:LightCounting、Arista、OpenAI 认为取决于系统约束;HyperLight 认为两者都通向“快宽”〔ECOC 0920-pm-Su4-I-05-HyperLight p3〕。

4.2 主要方案

厂商/组织方案关键规格(口径)状态来源
OCI MSA4λ×53.125 GBd NRZ,单纤双向,外置激光器每方向 212.5 Gb/s 原始速率,标称 200G 接口v1.0 规范已发布[W28]〔ECOC 0920-pm-Su4-I-02-OpenAI p13〕
LightmatterPassage EVK50 / EVK100 / M1000EVK50:16λ 双向,每波 56G NRZ,每纤 800 Gbps,1 km,<3 pJ/bit(PIC + 激光器);EVK100:16×100G PAM4;Guide 激光器每芯片 128 个以上、64λ 以上M1000 已可提供(自报)〔ECOC 0920-pm-Su4-I-06-LightMatter p6, p10, p14〕
Qualcomm × LightmatterP-CPO 光 I/OOFC 2026 演示:每纤 1.6 Tbps,200 m,106G PAM4 × 16λ DWDM演示〔ECOC 0920-pm-Su3-I-04-Qualcomm p6〕
CredoZeroFlap 有源光缆(宽并行 VCSEL)30 m,线缆体积最多减 75%,MTBF 1 亿小时;光 mesh 约 4 pJ/bit,对比铜交换约 14–17 pJ/bit(自估模型)可插拔产品已认证〔ECOC 0920-pm-Su4-I-07-Credo p3, p6〕
Coherent低电流 VCSEL 阵列 / 梳状 DWDM106G VCSEL 1.2 pJ/b、128G 1 pJ/b(16 通道,2.047T,实测);NRZ 慢宽 VCSEL 0.75 pJ/b(投影);梳状硅光 0.369 pJ/b(建模)实测与投影并存〔ECOC 0920-pm-Su4-I-04-Coherent p3–p6〕
Xscape PhotonicsCOMBX 可编程多波长激光器同一平台支持 CWDM4(20 nm)、LR4(4.5 nm)、CW-WDM(1 nm)栅格产品化中〔ECOC 0920-pm-Su4-I-08-XscapePhotonics p8〕
Microsoft Research × MediaTekMOSAIC microLED医用成像光纤上数百条低速通道,最远 50 m,功耗比激光光缆低约 50%;Computex 2026 展示 400G CPO目标 2027 年底商用[W29][W30]
AvicenaLightBundle microLED1 Tbps 评估套件,最多 335 条通道 × 3 Gbps,多芯光纤;ECOC 2026 演示基于 MPO 的可插拔连接器版本评估套件已出货[W31]
NVIDIADWDM 路线图起步 8λ DWDM 微环,50 Gbps PAM2,每纤 400G;硅光约 3.5–4 pJ/b(含激光器)路线图〔ECOC 0920-am-Su2-I-01-NVIDIA p13〕
OLIX以慢宽光互连连接推理芯片DX-1 计划 2027 年下半年研发中[W16]

4.3 核心优势(有数据支撑的部分)

  1. 省掉 DSP/FEC,时延低:单通道速率越高,SerDes、FEC 与时延负担越重。Lightmatter 给出 56G NRZ 约 1–2 pJ/bit、BER <1e-9 时基本不需要 FEC;112G PAM4 约 4–6 pJ/bit,需要 KP4 FEC;448G 需要更强的 FEC、时延更高。PCB 上的电互连距离从约 1 m(56G)缩到只能用 flyover 或 CPO(448G)〔ECOC 0920-pm-Su4-I-06-LightMatter p5〕。
  2. 光引擎边界的能效:Coherent 汇总的实测值在 0.9–1.2 pJ/b,建模值 0.369 pJ/b,并特别强调不同核算边界不能直接比较〔Coherent p5–p6〕。
  3. 用冗余提高可靠性:OpenAI 的对比表认为慢宽与快宽可以“用冗余路径降低等效失效率”;Credo 称廉价的备用通道可以无缝切换〔OpenAI p11–p12〕〔Credo p8〕。
  4. 规避电通道的物理墙:Arista 给出 448G 电接口的带宽需求:PAM4 约 112 GHz、PAM6 约 90 GHz、PAM8 约 75 GHz;超低损耗 PCB 在 112 GHz 约 2.1 dB/英寸〔ECOC 0920-pm-Su3-I-03-Arista p3〕。

4.4 挑战

  1. 反向齿轮箱会吃掉收益:今天的 ASIC 输出 200G PAM4,接慢宽光学要经过 PAM4 DSP 加反向齿轮箱。Arista、Ciena、Applied Materials 都指出这会削弱节能优势;Cole 的“唯一安慰”是它和全重定时 400G 的功耗相近〔Arista p6, p8〕〔Ciena p7〕〔AppliedMaterials p11–p12〕。原生收益要等 ASIC 集成 UCIe/OCI 接口(Ciena 的“Phase 2”),最终形态是光中介层(“Phase 3”)〔Ciena p7〕。
  2. 市场窗口:Cole 认为“200G 串行已在爬坡、标准已完成,4×50G 慢宽来不及”〔AppliedMaterials p3〕。
  3. 可靠性要靠现场数据:OpenAI 表示慢宽和快宽“需要现场验证”,快窄有可插拔选项、也有现场数据〔OpenAI p11–p12〕。
  4. 宽度难以回退:Ciena 指出宽度带来的封装面积、连接器和复杂度一旦选定难以回退,“慢宽等于押注单一技术”〔Ciena p4, p10〕。
  5. microLED 特有的问题:分析师提到色散限制距离、需要专用线缆与机架改造、缺少 MSA、业界若在 2027–2028 年转向 1.6T/3.2T 会遇到带宽天花板[W30]。
  6. 光纤与连接器的良率:EBO MSA 的数据是,1,088 个连接的板级光纤组装良率只有 23.0%,要把返修率压到 2% 需要单点失效概率约 7e-5〔ECOC 0922-MF-am-1220-EBOMSA〕。这对“宽”路线的影响尤其大。

4.5 本章判断

  • 2026 年的风向是“对冲而非站队”:超大规模云厂商通过 OCI MSA 为慢宽留了选项,但量产主线仍是 200G/400G 快窄(XPO、NPO)。
  • 慢宽最先落地的位置是 scale-up 的短距 GPU 链路和 scale-in(芯片到芯片、芯片到内存)。Marvell 把 uVCSEL/uLED I/O chiplet 列为 scale-in 的下一代〔ECOC 0920-pm-Su3-I-07-Marvell p4〕。可插拔主干网不会走慢宽。
  • 要盯的指标:原生 OCI 接口 ASIC 的发布时间;OCI 链路的现场 FIT 数据;microLED 在 50 m 以内、800G 下的实际功耗与良率;OLIX DX-1 能否在 2027 年下半年按时交付。

五、Cerebras CS-4、OLIX 与光学晶圆级引擎(oWSE)

5.1 CS-3(WSE-3):核心优势与挑战

WSE-3 规格:TSMC 5 nm,4 万亿晶体管,90 万个 AI 核,44 GB 片上 SRAM,稀疏 FP16 算力 125 PFLOPS,内存带宽 21 PB/s,片上 fabric 26.8 PB/s,网络带宽 150 GB/s,功耗约 27 kW[W32]。

核心优势:整个模型的层都放在片上 SRAM,内存带宽(21 PB/s)比 HBM 高出数个数量级,所以解码时每用户 token 速率极高。OpenAI 就是看中这一点签下 750 MW 推理合同,报道明确提到用它的大容量 SRAM 加速推理[W14]。

挑战(按公开规格推导):

  1. 片上与片外带宽差了约 5 个数量级:片上 fabric 26.8 PB/s,对外网络只有 150 GB/s[W32]。模型一旦超出单晶圆,就要跨晶圆做流水线。
  2. 容量:单晶圆 44 GB SRAM。前沿 MoE 模型动辄数千亿到万亿参数,需要多晶圆切分。
  3. 供电与散热:单系统约 27 kW[W32]。
  4. 独立分析的质疑:SemiAnalysis 称 OpenAI 的 GPT-6.1 Sol Ultrafast 实际跑在 NVIDIA GPU 上而非 Cerebras[W33]。这是第三方说法,说明大合同的实际落地节奏值得观察。

5.2 CS-4 的重大更新

CS-4 于 2026 年 8 月 18 日在 Supernova 2026 发布,技术细节在 Hot Chips 2026 披露[W34][W35]。

项目CS-3CS-4来源
晶圆1 片 WSE-33 片 WSE-3T(Turbo),装在 Nexus 机架平台上[W32][W35]
单晶圆算力125 PFLOPS(稀疏 FP16)250 PFLOPS(时钟翻倍)[W32]
单晶圆内存带宽21 PB/s43.2 PB/s[W32]
单晶圆 fabric26.8 PB/s53.5 PB/s(Cerebras 称是 Rubin NVL72 机架 NVLink 带宽 260 TB/s 的 200 倍以上)[W32][W35]
单晶圆对外网络150 GB/s300 GB/s;晶圆间每片合计 2.4 Tb/s、时延 2 µs[W32][W36]
系统合计—750 PFLOPS、132 GB SRAM、7.2 Tb/s I/O、129.6 PB/s 内存带宽[W32][W34]
核数 / SRAM / 工艺90 万核 / 44 GB / 5 nm不变[W32]
供电与散热约 27 kW模块化“背包”:每个背包的供电与散热是 CS-3 的 2 倍、部件少 50%;AC/DC 转换器离晶圆约 0.5 mm;每背包最多 30 个风冷电源模块,277 V AC 输入、54.5 V DC 输出;每晶圆功耗约 54 kW(STH 推算)[W35][W36][W32]
性能—比 CS-3 快最多 2 倍;每用户 token 速率最多达 GPU 的 30 倍(自报)[W34]

5.3 CS-4 解决了什么,还剩什么

解决了:

  1. 单晶圆算力与带宽翻倍:时钟翻倍,工艺不变。
  2. 在机架内把三片晶圆当作一个系统:执行流水线化,把大流量的张量和专家通信留在晶圆内部,只让较小的激活数据跨晶圆[W35]。
  3. 供电与维护的工程瓶颈:模块化背包、干式快插阀、漏液与冷凝传感器,维护时不必排空冷却液[W35]。

仍然存在:

  1. 容量没变:每晶圆仍是 44 GB SRAM,整机架 132 GB[W32]。大模型仍要跨多个机架切分。
  2. 晶圆间仍是电互连:每晶圆 2.4 Tb/s[W36],与片上 53.5 PB/s 相比仍然差了几个数量级。Cerebras 的发布材料没有提到光学[W35][W36]。
  3. 路线图把容量问题交给了 CS-6:
    • CS-5(2027 年,新 WSE 芯片):目标在开源模型上每用户每秒 1 万 token、每兆瓦每秒 300 万 token,支持 50 万亿参数以上的模型。
    • CS-6:在晶圆级 SRAM 与计算之上 3D 叠 DRAM,2024 年开始研发,目标是占地缩小一个数量级[W35]。ECOC 讲稿中“CS-6 在 Hot Chips’26 发布”指的就是这一路线图预告〔ECOC 0921-Mo4-Cerebras p9〕。

5.4 光学晶圆级(oWSE):Cerebras 与其他玩家

Cerebras 自己的光学路线:联合创始人兼首席系统架构师 Jean-Philippe Fricker 在 ECOC 的题目是“Heterogeneous Hybrid Bonding: A Path to Wafer-Scale Optical Systems”〔ECOC 0921-Mo4-Cerebras〕:

  • 堆叠结构为光学晶圆 / WSE / DRAM 三层〔p11〕。
  • 电光转换在晶圆表面、靠近每个计算区域完成,再由低损耗波导把信号送到晶圆边缘,避免电信号跨晶圆传输带来的功耗与带宽密度限制〔p11〕。
  • 列出五个设计维度:带宽密度(光 I/O 按晶圆边长算 BW/mm,电 I/O 按键合面算 BW/mm²)、激光器(集成还是外置)、面向键合通道重新优化的 SerDes、热兼容、可测试性与良率(“足够好的晶圆”策略、光测试接入、修复与冗余)〔p14〕。
  • 讲稿全程没有给出带宽或功耗数值。这是方向性表态,还没有产品。

其他玩家:

玩家方案关键规格核心优势挑战来源
LightmatterPassage M1000 3D 光子中介层(“光子超级芯片”)最高 114 Tbps(Tx+Rx),1,024 个 SerDes,4,000 mm² 硅片复合体,34 个 chiplet,256 根光纤,供电密度 >1.4 W/mm²;同一光罩 2×4 步进拼接成一整张可编程光网络;每封装最多 1.5 kW用光网络实现冗余与可编程,突破 I/O 按周长增长的限制;仿真显示万亿参数 MoE 训练时间可降到铜方案的 0.37 倍性能数据来自仿真;客户与量产规模未公开;融资 8.5 亿美元、估值 44 亿美元〔ECOC 0924-推定F2-Lightmatter p2, p9, p16〕[W37]
Marvell(Celestial AI)Photonic Fabric 光学 scale-up 互连2026 年 2 月 2 日完成收购,约 32.5 亿美元,另有与营收挂钩的对价到 2029 财年被大型芯片商整合,可直接进入定制 XPU 平台整合进度与首批产品规格未公开[W38]
台积电SoW-X 晶圆级系统 + COUPE 光引擎SoW-X:最多 16 颗满光罩 ASIC、80 个 HBM4、2,800 路 224G SerDes,裸片间带宽 260 TB/s;40 光罩版本规划在 2029 年;COUPE 从 2026 年起用于 CoWoS 上的 CPO代工厂级工艺与产能;NVIDIA CPO 已采用 COUPE光引擎与 SoW 的集成仍在路线图上;功耗在千瓦级[W39]〔ECOC 0920-pm-Su3-A-05-NVIDIA〕
imec300 mm 晶圆级 SiN 波导 + D2W 键合传播损耗 <0.15 dB/cm,间距 <6 µm;首个 300 mm 晶圆级光罩拼接互连波导;目标 <1 pJ/bit开放平台,可授权给多家使用仍在工艺平台阶段〔ECOC 0921-Mo12-A4-IMEC p14–p17〕

关于“oWSE/oPSE”:按你的 OFC 2026 论文索引的分类,它指晶圆级与 3D 光电集成。除上表外,OFC 2026 的两篇代表论文是:

  • TFLN 电光调制器与驱动 EIC 晶圆级异质集成的 CPO 引擎,带宽超过 100 GHz(PDP)〔OFC Th4A.6〕。
  • 3D 堆叠 7 nm EIC / 65 nm PIC 的 (8+1)×32 Gb/s DWDM 光 I/O,1.33 Tb/s/mm²(高分论文)〔OFC M4B.2〕。

5.5 OLIX「SRAM + 光」方案深度技术洞察

口径说明

OLIX 至今没有公开单芯片 SRAM 容量、工艺节点、代工厂、光互连带宽和功耗[W42]。本节分两类内容:

  • 公开信息:来自公司发布和媒体报道,逐条标注来源。
  • 推算:用已核实的同类方案(NVIDIA Groq 3 LPU、Cerebras WSE-3、OpenAI Jalapeño)和公开的工艺数据做数量级估算,都标为“推算”并写明假设。推算只用来说明约束在哪里,不是对 OLIX 真实规格的猜测。

5.5.1 方案到底是什么:电子计算 + 片上 SRAM + 光互连

媒体常称 OLIX 为“光子 AI 芯片”,也有报道用“光学张量处理单元(OTPU)”的说法[W42]。但多家报道对架构的描述是一致的:计算和存储在电子芯片上,光只负责芯片之间的连接[W43][W44][W45]。它不是用光做矩阵运算的“光计算”路线。

要素公开信息来源
公司2024 年 3 月以 Flux Corp 成立,2026 年 1 月更名为 OLIX Computing;总部伦敦;员工 140 人以上,分布在布里斯托、多伦多、旧金山、奥斯汀;创始人 James Dacombe[W42]
融资2026 年 2 月 2.2 亿美元(估值约 10 亿美元);8 月 3.12 亿美元 B 轮,投后估值 33 亿美元,Fundomo 领投,Arm、Hudson River Trading、Reed Hastings、英国主权 AI 基金参投;网络先驱 Nick McKeown 进入董事会[W42][W44]
系统形态X-1 平台是整机架方案,把一个模型分摊到多颗“按阶段专用”的芯片上[W44][W45]
首款芯片DX-1 专做 LLM 推理的 decode(解码)阶段;模型和 KV 缓存都放在片上 SRAM;不用 HBM,也不用先进封装[W43][W44]
互连自研“慢宽”光互连,芯片间直接用光传数据;采用 NRZ 编码(而不是 PAM4),以减少对信号处理的依赖;单条通道故障时有容错能力;最多可扩展到 10 万颗以上芯片[W43][W44]
调度确定性编译器在整个机架上排布负载[W44]
性能宣称1,000 亿参数模型每秒超过 1 万 token;多个 X-1 机架组成集群可运行 10 万亿参数模型[W43]
时间表2026 年晚些时候流片;首批客户试点与机架部署在 2027 年下半年(SiliconANGLE 一篇报道写的是 2027 年上半年,与其他信源不一致)[W42][W43][W45]

还没有公开的关键参数:工艺节点、代工厂、单芯片 SRAM 容量、芯片面积、光互连的波长数与每纤带宽、能效(pJ/bit)、整机架功耗、每 token 成本[W42]。

5.5.2 技术机理:为什么“SRAM 路线”必然要配“光互连”

这一节的三个推算,串起来说明了 OLIX 架构的内在逻辑。

(1) 容量:SRAM 装模型意味着要上百颗芯片(推算)

  • SRAM 密度已经接近停滞:台积电 N5 与 N3E 的高密度 SRAM 位单元都是 0.021 µm²,N3E 密度约 31.8 Mb/mm²;N2 降到 0.0175 µm²,约 38 Mb/mm²[W46][W47]。
  • 参照点:NVIDIA Groq 3 LPU 单芯片 500 MB SRAM(三星 4 nm),一个 LPX 机架 256 颗共 128 GB[W26];Cerebras 用整片晶圆也只有 44 GB[W32]。
  • 推算:一个 1,000 亿参数模型,按 FP8 约需 100 GB、按 FP4 约需 50 GB 来存权重(尚不含 KV 缓存)。
    • 按 Groq 3 的单芯片容量,需要约 100–200 颗芯片。
    • 即便采用 N2 工艺、在一颗约 800 mm² 的芯片里拿一半面积做 SRAM,也只有约 1.9 GB(400 mm² × 38 Mb/mm²),仍需约 25–50 颗。
    • 10 万亿参数模型(FP4 约 5 TB)则需要数千到上万颗。这与 OLIX“扩展到 10 万颗以上芯片”的宣称在数量级上一致。

结论:SRAM 路线把“内存容量问题”转化成了“芯片间互连问题”。模型被切得越碎,每个 token 要穿过的芯片就越多。

(2) 带宽:SRAM 让片内带宽过剩,瓶颈转到片间(推算)

  • 在批量为 1 的解码中,每生成一个 token 都要把所有激活权重读一遍。
  • 推算:一个 1,000 亿参数的稠密模型按 FP8 约 100 GB,要达到 1 万 token/s/用户,需要约 1 PB/s 的权重读取带宽。
  • 分摊到 50–200 颗芯片,每颗约 5–20 TB/s。这对 SRAM 来说不难:Groq 3 单芯片 150 TB/s[W26]。作为对照,HBM 路线的 Jalapeño 单芯片 15.4 TB/s[W21]。
  • 结论:SRAM 方案的内存带宽很充裕,真正的约束变成了芯片之间传激活值的时延。

(3) 时延预算:为什么是“慢宽 + NRZ”(推算)

  • 1 万 token/s 意味着每个 token 只有约 100 µs。如果模型沿流水线切在约 100 颗芯片上,每一级(计算 + 传输)的预算只有约 1 µs。
  • 已核实的对照数据:
    • 高速 PAM4 链路需要 FEC:112G 用 KP4,448G 需要更强的 FEC、时延更高;56G NRZ 在 BER <1e-9 下基本不需要 FEC,约 1–2 pJ/bit〔ECOC 0920-pm-Su4-I-06-LightMatter p5〕。
    • 即便是专为低时延设计的园区相干 FEC,也要 50–75 ns〔ECOC 0920-pm-Su4-A-04-Nokia p12〕。
    • 经过一级电交换机的事务时间约 1,000 ns、两级约 1,600 ns〔ECOC 0922-PF-1155-SalienceLabs p5–p6〕。
  • 结论:要把每一跳压到亚微秒、而且时延固定(确定性编译器需要可预期的时延),最直接的办法是芯片之间点对点直连、不经过交换机、用不需要 FEC 的 NRZ 低速多通道。这正是 OLIX 选的“慢宽 NRZ 光互连”。

(4) 为什么是光而不是铜:几百到上万颗芯片无法都放在铜的有效距离内。OpenAI 在 ECOC 给出的铜缆有效距离,200G/lane 约 1 m、400G 约 1 m〔ECOC 0920-am-Su1-B-02-OpenAI p4〕;Ciena 给出 200G 无源铜约 1.5 m〔ECOC 0920-pm-Su3-I-05-Ciena p10〕。慢宽光在保持低速简单调制的同时,把距离扩展到机架乃至机架之间。

一个容易被忽略的结构性优势:第四章提到,慢宽落地最大的障碍是今天的交换机和 GPU 输出 200G PAM4,要接 4×50G 光学就得加“反向齿轮箱”,这会吃掉大部分功耗收益〔ECOC 0920-pm-Su3-I-03-Arista p6, p8〕〔ECOC 0920-pm-Su3-I-08-AppliedMaterials p11–p12〕。OLIX 自己设计芯片,可以在芯片上直接做原生的慢宽 NRZ 光接口,天然绕开这个问题。这是它和“往现有 GPU 上加慢宽光模块”那类方案的根本区别。

5.5.3 与现有方案的对比

维度GPU / ASIC + HBM(Rubin、Jalapeño)NVIDIA Groq 3 LPX(SRAM + 电互连)Cerebras CS-4(晶圆级 SRAM)OLIX X-1(SRAM + 慢宽光互连)
权重存放HBM,如 Jalapeño 单芯片 216 GiB HBM4、15.4 TB/s[W21]片上 SRAM,单芯片 500 MB、150 TB/s;每机架 256 颗共 128 GB、40 PB/s[W26]晶圆上 SRAM,每晶圆 44 GB、43.2 PB/s;每机架 3 片共 132 GB[W32]片上 SRAM,容量未公开[W42]
模型切分少数芯片即可装下大模型大量芯片分摊少数晶圆分摊大量芯片分摊(宣称最多 10 万颗以上)
芯片间互连NVLink、以太网等,铜和光混合未公开具体互连形态晶圆内 fabric 53.5 PB/s;晶圆间每片合计 2.4 Tb/s(电)[W32][W36]自研慢宽 NRZ 光互连[W43]
定位训练 + 推理通用decode 专用,与 Rubin(prefill)配对[W26]推理为主decode 专用,按阶段拆分[W44]
供应链依赖HBM + CoWoS 先进封装不用 HBM晶圆级制造与封装(独家工艺)不用 HBM、不用先进封装[W43]
性能宣称Jalapeño 在 gpt-oss-120B 上每千瓦吞吐是 GB200 的 1.9 倍[W21]LPX + Rubin NVL72 在万亿参数模型上每兆瓦吞吐是 Blackwell NVL72 的 35 倍(自报)[W26]CS-5(2027 年)目标 1 万 token/s/用户[W35]1,000 亿参数模型超过 1 万 token/s[W43]
成熟度量产已全面量产,2026 年底前上线,Nebius 是首发客户[W26]CS-4 已发布[W34]未流片,2027 年交付[W42]

相对 HBM 路线的优势:

  1. 解码时延和每用户速度:SRAM 带宽比 HBM 高一个数量级以上,适合高交互、低批量的 decode。
  2. 绕开 HBM 与 CoWoS 产能:这两者是当前 AI 芯片最紧的供给约束,OLIX 把“不需要先进封装”作为核心卖点[W43][W45]。
  3. 架构顺应推理拆分的大方向:OpenAI 把一个请求拆成 prefill、draft、decode 三种硬件形态〔ECOC 0920-pm-Su4-I-02-OpenAI p4〕;NVIDIA 自己也用 LPU 做 decode、GPU 做 prefill[W26]。专用 decode 芯片的思路已被验证。

相对 HBM 路线的劣势:

  1. 容量效率低:同样一个模型要用多得多的芯片,芯片总面积、机架数和功耗随模型规模近似线性增长。
  2. 灵活性差:模型变大或上下文变长就要加芯片;HBM 方案可以在同一批芯片上换更大的模型。
  3. 只做 decode:prefill、训练仍要依赖 GPU,客户需要维护异构集群。

相对其他 SRAM 路线(Groq 3、Cerebras)的差异:

  • 与 Groq 3 相比:两者都是“多芯片 SRAM + decode 专用”。OLIX 的差异在光互连,理论上能把芯片数扩展得更多、距离更远、每跳时延更低。但 Groq 3 LPX 已在量产、背后是 NVIDIA 生态,OLIX 在时间上落后约一年。
  • 与 Cerebras 相比:Cerebras 用整片晶圆把大部分通信留在晶圆内部(53.5 PB/s),晶圆间只有 2.4 Tb/s;OLIX 用标准尺寸芯片加光互连,不依赖晶圆级制造,但每一跳都要经过光链路。两者在 2027 年的目标几乎相同(每用户 1 万 token/s)[W35][W43],会正面竞争。

5.5.4 能解决当前哪些挑战

  1. 解码阶段的“内存墙”:HBM 路线的每用户解码速度受限于 HBM 带宽,SRAM 把这个瓶颈移除了。
  2. HBM 与先进封装的供给瓶颈:不需要 HBM 和 CoWoS,可以用成熟的供应链扩产[W43]。
  3. Scale-up 的铜墙:200G 以上铜缆只有约 1–1.5 m,光互连让“一个模型分摊到上千颗芯片”在物理上可行。
  4. 互连时延与抖动:不经过交换机的点对点连接,加上不需要 FEC 的 NRZ,给确定性编译提供可预期的时延,这是长尾时延(尾延迟)稳定的前提。
  5. 慢宽落地的“反向齿轮箱”难题:自研芯片原生支持慢宽接口,不需要格式转换。
  6. 链路可靠性:多通道设计本身有冗余,单条通道故障可以容错[W43]。这回应了 OpenAI 对慢宽“需要可靠性证明”的关切〔ECOC 0920-pm-Su4-I-02-OpenAI p8〕。

5.5.5 面临的挑战

来自 SRAM 的挑战:

  1. SRAM 微缩已接近停滞:从 N5 到 N3E 完全没有缩小,N2 才缩小约 17%[W46][W47]。模型规模每年成倍增长,SRAM 容量却不会,所需芯片数只会越来越多。
  2. KV 缓存与并发用户数争夺同一块 SRAM(推算):以 Llama 2 70B 的公开结构(80 层、8 个 KV 头、head_dim 128)为例,每个 token 的 KV 缓存按 FP16 约 0.31 MiB。一个 4K 上下文的请求约 1.25 GiB,100 个并发用户就要约 125 GiB,与模型权重本身相当。OLIX 称 KV 缓存全部放在 SRAM 里[W43],那么长上下文、高并发就会直接转化为更多芯片。每用户速度很快,但每颗芯片能服务的用户数有限,每 token 成本是最大的问号。
  3. 利用率:按阶段拆分的专用芯片,要靠调度把 prefill 与 decode 的配比做对,负载变化时容易出现闲置。

来自光互连的挑战: 4. 制造、良率与封装:报道直接指出光子器件“出了名地难制造、难提良率、难规模化封装”[W42]。“不用先进封装”指的是不用 HBM 的 CoWoS,光引擎本身仍需要精密的光电封装。 5. 光纤与连接器的规模:几千到上万颗芯片的点对点光连接,光纤数量和连接器良率会成为量产瓶颈。EBO MSA 的数据是,1,088 个连接的板级光纤组装良率只有 23.0%〔ECOC 0922-MF-am-1220-EBOMSA〕。 6. 激光器与可靠性:多波长光源的寿命与失效率是慢宽方案的共性难题;OpenAI 要求用 FIT 置信上界评估,并需要现场数据〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p12〕。 7. 私有互连与生态:OLIX 的光互连是自研的,而行业的开放慢宽规范是 OCI MSA(4×53.125 GBd NRZ)[W28]。私有方案性能可以做得更激进,代价是客户无法混用第三方部件。

来自商业与竞争的挑战: 8. 时间窗口:2026 年底才流片,2027 年交付[W42]。同一个细分赛道里,NVIDIA Groq 3 LPX 已全面量产并在 2026 年底前上线[W26],Cerebras CS-5 在 2027 年瞄准同样的 1 万 token/s/用户[W35]。 9. 软件与模型兼容:公司称可以兼容现有模型与软件栈、不需要重写[W42],但确定性编译器能否跟上前沿模型结构的快速变化(MoE、长上下文、推测解码),还没有公开验证。 10. 尚无产品:The Next Web 的评价是它“还不是产品,而是一个押注”,所有宣称都停留在融资材料上[W45]。

5.5.6 判断与观察指标

  • 架构判断:OLIX 的方向(SRAM 放模型 + 慢宽光互连 + 按阶段拆分)在技术上自洽。每一个选择都针对一个真实的约束:内存墙、HBM 供给、铜墙、FEC 时延、反向齿轮箱。它是第一个把“慢宽光互连”作为系统核心、而不是附加部件的推理平台,对本文第四章“慢宽落地要靠原生接口”的判断是一个直接的验证机会。
  • 核心风险:成败取决于“芯片数 × 光链路数”的成本曲线,而不是单芯片性能。SRAM 容量停滞意味着模型越大,这条曲线越陡。
  • 要盯的指标:
    1. 2026 年底是否按时流片,以及公布的工艺节点和单芯片 SRAM 容量。
    2. 光互连的每纤带宽、pJ/bit 和链路 FIT 数据。
    3. 首个 X-1 机架能装下多大的模型、支持多少并发用户,以及每百万 token 成本(可与 NVIDIA 公布的 LPX 目标价每百万 token 45 美元对照[W26])。
    4. 首批客户名单:OpenAI、Microsoft 等 OCI MSA 成员是否在列。

5.6 本章判断

  1. CS-4 是“工程化升级”,不是“架构换代”:核数、SRAM、工艺都没变,收益来自时钟翻倍和三晶圆机架。真正的架构变化在 CS-5(新芯片)和 CS-6(叠层 DRAM)。
  2. 晶圆级系统最大的剩余瓶颈是“晶圆到晶圆”的带宽:片上与片外相差几个数量级。这正是光学晶圆级(Cerebras 光学晶圆、Lightmatter M1000、台积电 SoW-X + COUPE)要解决的问题。但目前只有 Lightmatter 给出了完整规格,Cerebras 还是方向性表态。
  3. 要盯的指标:CS-5 在 2027 年是否按时推出;CS-6 叠层 DRAM 的容量与带宽;Cerebras 是否在 CS-5 或 CS-6 中引入光学晶圆间互连;OpenAI 750 MW 合同的实际部署节奏。

六、跨专题总判断

  1. 三层同时在“光学化”,但节奏不同:
    • scale-across 的线路系统(FST + 多 rail)在 2026–2027 年进入标准化与放量。
    • scale-up 的光学(NPO/CPO、OCS、慢宽)在 2027–2028 年接力。
    • 晶圆级光学(oWSE)在 2028 年以后。
  2. 推理正在重新定义互连:OpenAI 的“满足 SLA 时延下每瓦每秒请求数”、Salience 的“随负载静态”、NVIDIA 和 Groq 的 LPU 解码,都把低时延与确定性放到带宽之前,这对 OCS 和慢宽有利。
  3. 超大规模云厂商用“投资 + MSA”替代收购:NVIDIA 2026 年在光学上的公开投资至少有 Coherent、Lumentum、Marvell 各 20 亿美元,外加参与 iPronics 1.25 亿美元的轮次;OpenAI 靠 Broadcom 的 10 GW 合作和 OCI MSA 施加影响,没有收购光子公司。
  4. 可比性提醒:本文所有 pJ/bit、功耗降幅都是各家在不同核算边界下的自报、投影或建模值。Coherent 在 ECOC 上特别提醒了这一点〔ECOC 0920-pm-Su4-I-04-Coherent p5〕,使用时不要跨表横向比较。

参考来源

本地资料:ECOC 2026 讲稿笔记(〔ECOC …〕标注)、OFC 2026 论文全文(〔OFC …〕标注)、《全球 OCS 技术与产业》(2026-09-08,引用 Agrell 等《Roadmap on optical communications》2024)。

网络信源: