资料范围与引用口径
- ECOC 2026 讲稿:〔ECOC 文件名简写 pN〕,pN 为现场拍摄 PDF 的页码,见 ECOC 2026 讲稿笔记。
- OFC 2026 论文:〔OFC 论文号〕,例如〔OFC W4H.5〕。
- 网络信源:[W1]…[W38],完整链接见文末“参考来源”。
- 口径标注:“自报”指厂商或讲者自述;“仿真”“实验”“现网”按原文标注;“OCR”指从拍摄页识别、未逐字核对的内容。不同口径的数字不放进同一张对比表横向比较。
- 两处前提说明:
- 检索范围内没有 OpenAI 收购“Onlix”的任何报道。名字最接近的是伦敦公司 OLIX,它仍独立运营,2026 年 8 月以 33 亿美元估值完成 B 轮融资。收购核实见第二章,OLIX「SRAM + 光」技术方案分析见第五章 5.5 节。
- “oWSE/oPSE”沿用你的 OFC 2026 论文索引中的分类,指晶圆级与 3D 光电集成(光学晶圆级引擎、晶圆级 CPO 光引擎、3D 堆叠光 I/O 等),详见第五章。
执行摘要
- Scale-across 的本质是“算力合并”,不是“数据合并”。 单一园区的供电(单 DC 50–300 MW,下一代训练需 1–5 GW)已经装不下一次训练,所以要把多个数据中心在逻辑上合成一个集群。北美由超大规模云厂商自建专用 AI WAN(Microsoft Fairwater),中国由国家级算力网络和运营商主导(FNTF,跨约 2,000 km 可达单 DC 98% 效率),欧洲还处在 AI Gigafactory 的选址与融资阶段。光层上,全谱转发器(FST)+ 多 rail 线路系统已经是 Ciena、Nokia、华为、中兴四家设备商的共同主推方向,Google 是共同设计方。
- OpenAI 没有收购光子公司,它的芯片布局是“自研推理 ASIC + 多供应商算力”。 与 Broadcom 合作的 Jalapeño 于 2026 年 6 月 24 日发布,并在 Hot Chips 2026 披露规格:单芯片 700 W、216 GiB HBM4、13.4 PFLOPS MXFP4,128 芯片本地域 + 2,048 芯片全局域。驱动力是推理成为主负载:ChatGPT 周活超过 10 亿,衡量指标变成“满足 SLA 时延下每瓦每秒请求数”。
- NVIDIA 投资 iPronics(2026 年 9 月 2 日,1.25 亿美元轮次)押的是 scale-up 层的光电路交换。 原因是系统带宽集中在 scale-up 层,而 OCS 能在不增加收发器与电交换机的前提下,把高带宽域扩展到机架之外。推理(尤其 LPU 流水线、MoE 解码)的流量“随部署静态”,最适合 OCS。但 NVIDIA 自己列出了插损、成本、可靠性、端口密度四道门槛,需求真正放量的时间点更可能在 2027–2028 年、与 NPO/CPO 同步。
- Slow & Wide 在 2026 年从“概念”变成“有 MSA、有样机、有反对者”。 OCI MSA(AMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAI)在 3 月发布 v1.0 规范(4×53.125 GBd NRZ、单纤双向)。能效优势在光引擎边界可以做到约 1 pJ/bit 以下。反方(Applied Materials 的 Chris Cole、Ciena)认为 200G/400G 串行已在量产窗口,“今天设计的慢宽到来时会过时”。决定胜负的是可靠性现场数据和反向齿轮箱的功耗。
- Cerebras CS-4(2026 年 8 月 18 日发布)用“三晶圆一机架”解决了 CS-3 单晶圆的容量与供电瓶颈,但内存容量问题要到 CS-6(3D 叠层 DRAM)才会根本改变。 晶圆间互连目前仍是电学的(每晶圆 2.4 Tb/s)。Cerebras 在 ECOC 上把“光学晶圆 + WSE + DRAM 三层混合键合”列为方向,但没有给出数值。光子晶圆级阵营的其他玩家:Lightmatter(Passage M1000,114 Tbps)、Marvell(已完成收购 Celestial AI)、台积电(SoW-X 规划到 2029 年)、imec(300 mm 光罩拼接 SiN 波导)。同属“SRAM 放模型”推理路线的 OLIX 用自研慢宽光互连连接大量芯片,2027 年交付,与 NVIDIA Groq 3 LPX、Cerebras CS-5 正面竞争(见 5.5)。
一、Scale Across:为什么要“合并数据中心”,业界怎么连
1.1 先回答前提:是“数据合并”带来的变化吗?
不是。从证据看,驱动力是算力无法在单一站点容纳,而不是数据的汇聚。
- 供电上限:单 DC 电力 50–300 MW(引 Microsoft OFC 2026 Workshop),下一代 LLM 训练需约 1–5 GW;Google(俄亥俄 + 爱荷华,4 个 DC,80 km)与 NVIDIA(3 个 DC,40 km)已有多站点规划〔ECOC 0923-We5-B-中兴 p4〕。KDDI 在 OFC 上把供电、散热与空间列为单一数据中心无法承载 AI 基础设施的三个原因〔OFC W4H.3〕。
- 规模数量级:Nokia 统计每个 AI 园区有 4–12 栋楼,园区间距 2–40 km,并称“园区光纤数量已成危机”〔ECOC 0920-Su3Su4-A 全场扫描 p111〕。Ciena 与华为把 scale-across 的系统规模定为:传统 DCI 约 200 Tb/s → scale-across 超过 10 Pb/s,扩容粒度从“每波长”变成“每光纤对”,rail 数从约 10 条到 100 条以上〔ECOC 0920-am-Su2-B-02-Ciena p10〕〔ECOC 0920-pm-Su4-C-03-华为 p5〕。
- 流量预测:Cignal AI 预测 scale-across 占云可插拔带宽的比例从 2025 年的 5% 升到 2030 年的 72%,2028 年超过城域/前端 DCI;2030 年 scale-across 支出 87 亿美元,其中线路系统占 55%(预测)〔ECOC 0922-MF-am-1140-CignalAI p7–p9〕。Cisco 引用的相对增速:scale-across(1M+ GPU)14 倍,前端 DCI 7 倍〔ECOC 主分析师笔记04-Marvell p3〕。
所以更准确的说法是:把多个数据中心“合并”成一台逻辑上的超级计算机。Microsoft 把它称为“AI superfactory”[W1],NVIDIA 称为“giga-scale AI super-factories”[W3]。
1.2 北美、欧洲、中国:主流厂家怎么建
| 区域 | 代表项目 | 建设方式 | 规模与关键数字 | 来源 |
|---|---|---|---|---|
| 北美 | Microsoft Fairwater(威斯康星 + 亚特兰大) | 超大规模云自建园区 + 专用 AI WAN,把两个站点当作一个“AI superfactory” | 每机架最多 72 颗 Blackwell GPU,约 140 kW/机架、1,360 kW/排;两层以太网后端,GPU 间 800 Gbps;过去一年新增超过 12 万英里光纤;亚特兰大站点“以 3 个 9 的成本达到 4 个 9 的可用性”,不配置现场发电和 UPS | [W1][W2] |
| 北美 | OpenAI Stargate 等 | 与 Oracle、SoftBank 合资,约 10 GW / 4 年,同时向 NVIDIA(≥10 GW 意向)、AMD(最多 6 GW MI450,2026 年下半年先上 1 GW)、Broadcom(10 GW 自研加速器)、Cerebras(750 MW)多方采购 | 见第二章 | [W12][W13][W14] |
| 北美 | 多 rail 线路系统(HyperRail)与多站点训练;TPU 集群长期使用 OCS | 每站单个 ILA 机房,功耗下降约 80%(自报) | 〔ECOC 0920-am-Su2-B-01-Google p5〕 | |
| 欧洲 | EU AI Gigafactories(InvestAI) | 公共 + 私人资本,单站点 10 万颗以上先进 AI 芯片 | InvestAI 计划撬动 2,000 亿欧元,其中 200 亿欧元用于 AI gigafactory;因各国申报踊跃,名额从 4–5 个扩到 7 个;76 个联合体表达意向;征集 2026 年 11 月 12 日截止,2027 年初定点 | [W6] |
| 欧洲 | OVHcloud | 区域 Fabric 环,“一组区域共享一套服务栈” | <10 km 用长距可插拔直连;>10 km 用 800G ZR/ZR+ 加线路系统,跨段约 100 km | 〔ECOC 0920-am-Su1-C-00 p14–p16〕 |
| 欧洲 | BT | 运营商视角:AI 流量在消费者流量中尚不明显 | 核心流量超过 34 Tbit/s;推理约“一个波长”的量级,现有 ROADM 即可承载;训练需要 scale-across,形态是“光纤岛” | 〔ECOC 0920-am-Su1-C-00 p19–p26〕 |
| 中国 | 未来网络试验设施 FNTF(东数西算骨干) | 国家级确定性网络,把分散的数据中心组成算力池 | 2025 年 12 月 3 日投运;跨约 1,243 英里(约 2,000 km),40 个城市、约 34,175 英里光传输线路;效率达单一数据中心的 98%;50 Gbps 确定性通道 | [W7][W8] |
| 中国 | 中国电信 | 运营商主导的跨城 DCI + OCS 城域池化 | 最多 3 个跨城 DC、1,024 GPU,训练效率超过 97%;WSON 恢复 <50 ms、最长路由 640 km;G.654.E 光纤 ≤0.172 dB/km | 〔ECOC 0923-We-F-00 标准化专场II p31〕〔ECOC 0923-MF 连拍 p6–p8〕 |
| 中国 | 中兴 + 长飞 | 设备商 + 光纤商联合现场试验 | 600 km 长途跨 AIDC,1,024 GPU 训练 LLaMA2-70B,DP 效率损失 <5%、PP <1% | 〔OFC W4H.5〕 |
| 中国 | 阿里云 + 中国电信 | 运营商拥有设施、云厂商提供服务 | 2026 年 4 月韶关智算中心上线,1 万张平头哥“真武”国产 AI 卡 | [W9] |
三种模式的差别很清楚:
- 北美:云厂商把“算力 + 光纤 + 网络芯片”纵向整合。
- 中国:国家确定性网络与运营商 OTN/OCS 承担跨域连接,同时受国产芯片单点规模的约束,更需要把多个中等规模集群合起来。
- 欧洲:瓶颈在资本与选址,技术上多数复用运营商的现有光网络。
1.3 训练与推理为什么都有“合并”需求,但程度不同
训练:数据并行(DP)的梯度同步是跨站点流量的主体,但在合理切分下带宽需求可控。中兴在 OFC 的现场试验里给出了完整计算〔OFC W4H.5〕:
- 切分方式:LLaMA2-70B,1,024 GPU,PP=8、TP=8、DP=16。每次 DP 通信每 GPU 约 4.37 GB。
- 带宽需求:要让通信时间只占 1%–5%,线路侧需要 3.2–16 Tb/s。
- 实际配置:取 1:8 收敛后为 12.8 Tb/s,由 16 个 800G 相干模块承载(135 GBaud PCS-16QAM,OTN)。
- 效果:跨 600 km,DP 效率损失 <5%,PP 损失 <1%。
这说明只要把张量并行留在站内、只让 DP/PP 跨站,几百公里是可行的。
距离敏感度取决于 GPU 代际。Corning 在 ASTRA-sim 上仿真 GPT-3 175B、8,192 GPU〔ECOC 0924-Th1-G1-Corning p6–p10〕:
- 10 km 以内计算与通信几乎完全重叠。
- H100 在约 10–30 km 起开始下降,A100 要到约 100 km 以上。
- DC 间距 1,000 km 时,训练时间相对 0.3 km 基线:H100 约 26 倍,A100 约 4 倍。
- 空芯光纤能把 H100 的 26 倍惩罚降到约 17 倍(仿真)。
结论是:GPU 越快,对跨站时延越敏感,这正是空芯光纤在 scale-across 中的价值所在。
KDDI 的测试床从另一侧验证了这一点〔ECOC 0922-Tu1-G1-KDDI p7–p10〕〔OFC W4H.3〕:
- RDMA 时延 = 14.514 + 9.836·x µs(x 为公里数)。
- 在 0、20、30 km 下,All-to-All/All-Reduce 的作业完成时间几乎无差异。
- 4 个集群各相距 30 km 互连,作业完成时间与单数据中心等规模集群相当。
推理:跨站需求来自三点:
- 资源池化与容量利用:华为的实网测试把模型首末层放在本地卡、中间层放在云端,部分场景算力效率损失 <5%〔ECOC 0920-pm-Su4-C-03-华为 p7〕。
- 分离式推理(prefill/decode 分离)需要“高容量、零丢包”连接:Telefónica 认为部分 AI 用例只有拥有边缘算力的运营商才能提供〔ECOC 0920-am-Su1-I-01+02-Telefonica p9, p14,OCR〕。
- Microsoft 的判断:“训练已从单一的整体作业演变为多种不同需求的负载”[W2]。
不过推理的跨站带宽远小于训练。BT 的估计是推理约“一个波长”的量级〔ECOC 0920-am-Su1-C-00 p25〕。因此 scale-across 的光层规模主要由训练决定,推理决定的是时延与可靠性要求。
1.4 业界 Scale-across 的网络互联方案与架构
可以分四层来看:
| 层 | 方案 | 代表产品与关键规格 | 来源 |
|---|---|---|---|
| 交换/路由(L2/L3) | 跨站以太网 + 深缓冲 + 长距拥塞控制 | NVIDIA Spectrum-XGS(2025 年 8 月 22 日,Hot Chips 2025):随距离自动调整的拥塞控制、精确时延管理、端到端遥测;Broadcom Jericho4:3 nm,51.2 Tb/s,HBM 包缓冲(比片上缓冲多 160 倍),支持 100 km 以上 RoCE,3.2T HyperPort(4×800GE 合成 1 个逻辑端口),单系统最多 36,000 个 HyperPort;Cisco 8223 / Silicon One P200:3RU、64×800GE、51.2T,支持最远 1,000 km 的相干链路 | [W3][W4][W5] |
| 协议/代理 | 在 DCI 边缘做 RDMA 代理 | 华为 OTN-Proxy:支持 >100 Tb/s,带代理时吞吐与 DCI 距离基本无关(曲线数值看不清,OCR);KDDI OCS 网关:ZR 直连 scale-up 交换机,实现 RDMA-over-WDM,相邻集群最远 80 km | 〔ECOC 0920-pm-Su4-C-03-华为 p6〕〔OFC W4H.3〕 |
| 光模块 | 按距离分档 | Marvell:>10 km 用 1.6T ZR/ZR+,2–10 km 用 O 波段 Coherent-Lite 1.6T/3.2T;Nokia:1600ZR 约 236 GBd 单载波(约 2026 年第二季度完成互操作),1600ZR+ 为 2×约 126 GBd、最远约 1,000 km(约 2026 年第三季度);园区 FEC 时延须控制在 50–75 ns;800ZRx 全球出货已超过 10 万端口(2026 年第二季度,Cignal,OCR) | 〔ECOC 0920-pm-Su4-A-01-Marvell p5〕〔ECOC 0920-pm-Su4-A-04-Nokia p12–p13〕〔ECOC 0922-MF-am-1140-CignalAI p10〕 |
| 线路系统 / 光纤 | FST + 多 rail、C+L/S 波段、空芯光纤 | 见 1.5;Azure:在空芯光纤上用 400G ZR 跑全 C 波段 3 跨 427.97 km(记录);中国电信:S+C+L 现网试验约 17–20 THz | 〔ECOC 0922-Tu3-H4-Azure p12–p13〕〔ECOC 0923-MF 连拍 p7〕 |
学术界还有一条“低功耗相干”路线:北京大学与上海交大的 PDP 论文用电光梳共享载波与时钟,做出 18λ×384 Gb/s 超信道,采样抖动 <0.9 ps,从而可以做“波特率采样”的 Coherent-Lite 接收,1 小时内长期 SNR 代价仅 0.12 dB,明确面向跨区 AIDC 分布式训练〔OFC Th4C.8〕。
1.5 FST 与 Multi-Rail:是否主推,谁在做,优势与挑战
结论:是主推方向。 四家设备商都已有产品,且都把“以光纤对为交付单位”作为 scale-across 的核心叙事。Google 以共同设计方身份在推动。Cignal 的数据(线路系统支出占比从 2025 年的 32% 升到 2030 年的 55%)说明成本重心正在从模块转向线路系统〔ECOC 0922-MF-am-1140-CignalAI p8〕,FST 与多 rail 正是针对线路系统做的集成。
| 厂商 | 方案 | 关键规格(均为自报) | 时间 | 来源 |
|---|---|---|---|---|
| Ciena | 全谱转发器(WaveLogic 6 1.6T)+ RLS HyperRail(第二代 RLS,与超大规模云共同设计) | 16 对光纤场景:被管设备 192→32(-84%)、机架单元约 -75%、功耗约 -50%;每机架从 4 条 rail 增到 128 条,EDFA 密度 32 倍;每对光纤从 60–120 个插件变成 1 个线路端口;传统需 22 个机房,多 rail 只需 1 个 | OFC 2026 发布;2026 年底前完成首批客户标准化,2027 年开始放量 | 〔ECOC 0920-pm-Su4-C-04-Ciena p3–p4〕〔ECOC 0920-am-Su2-B-02-Ciena p8〕[W10] |
| Nokia | 1830 GX Multi-rail OLS | 1RU 支持 4 条 rail,40RU 机架最多 160 条;ILA 密度是传统方案的 40 倍、当前先进方案的 8 倍;每条 rail 功耗降低 60% 以上 | 2026 年下半年供货 | [W11] |
| 华为 | FST + 4-Rail OA | 单系统每纤 25.6T(C96),C96+L96 时 51.2T;4-Rail OA 在 1U 内集成度提高 75%,达到单 rail 级可靠性 | 已在 ECOC 发布 | 〔ECOC 0920-pm-Su4-C-03-华为 p5〕 |
| 中兴 | FST + OMC 架构的 DCI-BOX;19.1 THz S+C+L 800G CFP2 | 节省光纤 74.8%(讲者原文);DSP 137 GBd | 产品方向 | 〔ECOC 0923-We5-B-中兴 p10–p15〕 |
| Google(客户) | HyperRail | 每站单个 ILA 机房,功耗约 -80%;从 4 条 rail 扩到 8 条及以上 | 部署中 | 〔ECOC 0920-am-Su2-B-01-Google p5〕 |
核心优势:
- 可管理对象数量下降一个数量级:FST 把“每光纤对 60–120 个插件”变成 1 个线路端口〔Ciena p8〕。
- 站点与功耗:多个放大器共用泵浦、无制冷多芯片泵浦,每 rail 功耗降 60% 以上(Nokia)、单站功耗降约 80%(Google)。
- 频谱效率:Ciena 称,在城域 DCI 中,转发器方案(48×1.6T、200 GHz,共 76.8 Tb/s)比可插拔方案(64×800G、150 GHz,共 51.2 Tb/s)多 50% 容量〔ECOC 0923-MF 连拍 p70〕。
挑战:
- 站点电力与泵浦供给变成新规格:Ciena 下一代 X-Large ILA 机房站点功率 400 kW,每站最多 20,736 条 EDFA rail、最高 4 MW / 5,000 A 供电〔ECOC 0920-pm-Su4-C-04-Ciena p2〕。
- 与可插拔的边界之争:Google 主张用可插拔闭合链路、追求“够用的 SNR”,Ciena 自己也同时出货 WL6 Nano 可插拔,二者其实是按场景切分〔ECOC 0923-MF 连拍 p69–p71〕。
- 供应链:线路系统部件交期 12–18 个月,产能受 InP 晶圆限制〔CignalAI p9,OCR〕。
- 术语歧义:NVIDIA Spectrum-X 的“多平面多 rail”是 scale-out 的交换拓扑(8 平面、4 rail,交换机数量省 1.7 倍),与线路系统的多 rail 是两回事〔ECOC 0921-MF-pm-1340-NVIDIA p9–p10〕,引用时要区分。
1.6 本章判断
- Scale-across 的光层在 2026–2027 年会以“FST + 多 rail + 1.6T ZR/ZR+”为主干,空芯光纤在时延敏感的站点间做选择性部署。领纤自报空芯光纤价格超过 3,000–5,000 美元/km(SMF 为 20–40 美元/km),累计产量约 83 km〔ECOC 0921-Mo3-B1-领纤 p13, p60〕。
- 中国路线的特点是“OTN/OCS + 确定性网络”,北美路线是“以太网深缓冲 + 专用光纤”,两者在光层会趋同,在协议层会长期并存。
- 要盯的指标:各家 multi-rail 的首批客户标准化时间(Ciena 2026 年底)、1600ZR/ZR+ 互操作进度(2026 年第二、三季度)、跨站训练的效率损失能否稳定在 5% 以内(中兴、中国电信、FNTF 已给出 97%–98% 的效率数据)。
二、OpenAI:不是收购,而是“自研推理芯片 + 多供应商算力”
2.1 事实更正:OpenAI 没有收购 OLIX
- 伦敦初创公司 OLIX Computing 于 2026 年 2 月融资 2.2 亿美元(估值约 10 亿美元),8 月 4 日完成 3.12 亿美元 B 轮,投后估值 33 亿美元,仍是独立公司[W15][W16]。
- 它的首款推理芯片 DX-1 计划 2027 年下半年推出,架构正是本文第四章讨论的“slow and wide”光互连[W16]。有报道称 DX-1 对 1,000 亿参数模型可达每用户每秒 1 万 token 以上,且不需要 HBM[W40](该数字来自二手报道,建议以官方资料为准)。
- OpenAI 2025–2026 年公开的收购里,硬件方向只有 io(Jony Ive 的设备公司,65 亿美元)和相机算法公司 Glass Imaging(2026 年 9 月,超过 3 亿美元),没有芯片或光子公司[W17][W18]。
- 与 OLIX 最接近的交集,是 OpenAI 作为创始成员参与的 OCI MSA:光学 scale-up 的开放规范[W19]。
2.2 OpenAI 的芯片布局(截至 2026 年 9 月)
| 项目 | 内容 | 来源 |
|---|---|---|
| 与 Broadcom 合作 | 2025 年 10 月宣布共同设计并部署 10 GW 自研加速器 + 以太网系统,2026 年下半年开始,2029 年底完成;Mizuho 估计代号“Titan”的整体交易价值 1,500–2,000 亿美元(分析师估计) | [W13] |
| 首颗芯片 Jalapeño | 2026 年 6 月 24 日发布,定位推理 | [W20] |
| Jalapeño 规格(Hot Chips 2026) | 13.4 PFLOPS MXFP4,216 GiB HBM4、15.4 TB/s,封装功耗 700 W;scale-up 带宽:128 芯片本地域 600 GB/s、2,048 芯片全局域 200 GB/s;2,048 芯片系统共 27 EFLOPS、432 TiB 内存;用 Broadcom Tomahawk 6 组成“半扁平化”两级 Clos | [W21] 〔ECOC 0920-pm-Su4-I-02-OpenAI p5–p6〕 |
| 开发节奏 | 2024 年底定架构 → 2025 年 RTL 冻结 → 2025 年底流片 → 2026 年初开始跑 Codex,随后接入 ChatGPT;用 AI 优化的内核比专家手写快 1.5–1.8 倍 | [W21] |
| 性能对比 | gpt-oss-120B 上,Jalapeño(700 W)对比 GB200(1.2 kW):每千瓦混合 token 吞吐高 1.9 倍,端到端时延低约 1.7 倍;DeepSeek R1 670B 上:吞吐高 1.7 倍,时延低 3.6 倍;ECOC 讲稿中对比 GB300 MTP:最小端到端请求时延 1.65 s 对 3.69 s,解码可达约 700 tokens/s/用户 | [W21] 〔ECOC 0920-pm-Su3-A-02-OpenAI p7–p8〕 |
| 多供应商算力 | NVIDIA ≥10 GW 意向(NVIDIA 随部署最多投资 1,000 亿美元);AMD 最多 6 GW MI450(2026 年下半年先上 1 GW);Cerebras 750 MW(Cerebras 称价值超过 200 亿美元,另有到 2030 年追加 1.25 GW 的期权) | [W41][W12][W14] |
2.3 需求变化:为什么现在做芯片
- 推理成为主负载:ECOC 讲稿引用 ChatGPT 周活从 7 亿(2025 年 9 月 15 日)→ 9 亿以上(2026 年 2 月 27 日)→ 10 亿以上(2026 年 8 月 31 日);Codex 周活从 160 万 → 500 万以上(2026 年 7 月 9 日)〔ECOC 0920-pm-Su4-I-02-OpenAI p3〕。TechCrunch 报道 OpenAI 的分工是:算力更密集的预训练仍主要用 NVIDIA,自研芯片瞄准推理成本[W20]。
- 一个请求被拆成三种硬件形态:Prefill(算力重、通信平滑)、Draft 模型(小模型、超低批量、受时延限制)、Spec-verify/Decode(受 HBM 带宽限制,MoE 通信突发)。核心指标是“满足 SLA 时延下每瓦每秒请求数”〔ECOC 0920-pm-Su4-I-02-OpenAI p4〕。通用 GPU 很难同时优化这三种形态,这是自研 ASIC 与引入 Cerebras 晶圆级推理的共同原因。
- 互连成为可靠性问题:OpenAI 在 ECOC 的三场报告都强调“恢复时间是交付性能的一部分”,要求用 FIT 置信上界公式评估链路〔ECOC 0920-pm-Su3-A-02-OpenAI p10〕〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p10〕。
2.4 OpenAI 在光互连上的实际动作
- 今天用铜:Jalapeño 机架内是铜背板,每机架 128 颗 ASIC(16 托盘 × 8)〔ECOC 0920-am-Su1-B-02-OpenAI p7〕。
- 路线选择的顺序:先用铜(看链路预算)→ 铜不够时用快窄可插拔 → 短距 GPU 链路可用带冗余路径的慢宽,但“需要可靠性证明”〔ECOC 0920-pm-Su4-I-02-OpenAI p8〕。
- 用系统结果做比较:比较铜、可插拔、NPO、CPO 时看请求时延与每请求能耗,而不是单看链路指标〔ECOC 0920-pm-Su3-A-02-OpenAI p10〕。
- 参与标准:作为 OCI MSA 创始成员,推动 4λ×53.125 GBd NRZ 单纤双向的 200G 接口,但在 ECOC 上明确表示“需要进一步做故障与恢复分析”〔ECOC 0920-pm-Su4-I-02-OpenAI p13–p14〕[W19]。
判断:OpenAI 的策略是“掌握负载定义权 + 分散供应”,不是垂直收购光子公司。它对光互连的影响力来自两处:Jalapeño 与 Titan 的采购规模(10 GW),以及 OCI MSA 的规范话语权。光子初创公司(包括 OLIX)更可能成为它的供应商或 MSA 生态成员,而不是被收购对象。这一点需要跟踪 2027 年 OLIX DX-1 的客户名单来验证。
三、NVIDIA 投资 iPronics:Scale-up 为什么要用 OCS
3.1 事件
- 投资:2026 年 9 月 2 日,NVIDIA 与 Maverick Silicon、Light Street Capital 共同出资 1.25 亿美元,支持 iPronics 第二代硅光 OCS,iPronics 累计融资 1.77 亿美元[W22][W23]。iPronics 于 2019 年从瓦伦西亚理工大学分拆。
- 产品现状:当前芯片 32 端口,72 端口和 144 端口版本在研;目标每机架单元最多 720 个端口对[W22]。
- 放在 NVIDIA 光学投资序列里看:2026 年 3 月 2 日分别投资 Coherent 和 Lumentum 各 20 亿美元,3 月 31 日投资 Marvell 20 亿美元[W24][W25]。iPronics 这笔是其中唯一一家 OCS 专业公司。
3.2 为什么在 Scale-up 用 OCS:NVIDIA 自己的论述
NVIDIA 研究团队(Bakopoulos、Mentovich、Lapukhov 等)在 OFC 2026 的邀请论文中,把 OCS 的插入点分为 scale-across、scale-out、DPU 和 scale-up 四层,并明确写道:“系统的大部分带宽集中在 scale-up 层,这里引入 OCS 最难,但影响最大;它可以在不增加收发器和电交换机全部成本的前提下,把高带宽域扩展到多个机架,并形成更大的资源池”〔OFC M3F.6〕。
具体动因:
- 带宽集中:GPU 带宽每两年翻倍(2.4 → 3.6 → 7.2 Tb/s),GPU 域 8 → 72 → 数百颗,机架功率 25 kW → 150 kW → 1 MW;GPU 到一级交换的距离从 0.5 m 扩到最长约 30 m,“铜到达极限”〔ECOC 0920-am-Su2-I-01-NVIDIA p8〕。
- 减少光电转换次数:iPronics 比较了三种 scale-up 拓扑,功耗从高到低依次是:机架内 EPS+CPO 加机架间 OCS、扁平 EPS、扁平 OCS。电交换机的功耗随代际升到 64×1600G 约 3,500 W,iPronics 系统约 30 W + 0.78 W/激活通道〔ECOC 0920-am-Su2-I-03-iPronics p3, p13〕。
- 把故障变成重路由:NVIDIA 在 ECOC 提出“用 OCS 重构把故障变成重路由”〔ECOC 0920-am-Su2-I-01-NVIDIA p10, p20〕;OFC 论文还提出可以用 OCS 纠正布线错误、加快大系统上线〔OFC M3F.6〕。
- 推理产品线的新需求:NVIDIA 通过 200 亿美元的 Groq 授权与人才交易推出 Groq 3 LPU。单芯片 500 MB SRAM,每个 LPX 机架 256 颗;由 LPU 做 decode、Rubin GPU 做 prefill[W26]。The Register 在报道 iPronics 投资时指出,OCS 最适合“网络路径不常变化”的场景,例如 LPU 集群的流水线并行[W22]。
3.3 训练与推理中的使用场景
| 场景 | 流量特征 | OCS 的作用 | 证据 |
|---|---|---|---|
| 训练:按作业重构拓扑 | 每个作业的并行切分固定,作业间变化 | 按作业把机架组合成 torus 或其他拓扑,跳过故障节点 | Google TPU 长期使用 OCS[W22];TPU 8t 单超级 Pod 9,600 芯片(3D torus)[W27] |
| 训练:故障韧性 | 大集群单点故障频繁 | 备用路径切换,恢复时间计入交付性能 | 〔OFC M3F.6〕〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p10〕 |
| 推理:MoE/专家并行 | 按模型部署(以及 SLO)静态配置,“推理框架掌握路由分配需要的全部信息” | 一次配置、长期使用,不需要微秒级切换 | Salience Labs:scale-up 交换“随负载静态”〔ECOC 0922-PF-1155-SalienceLabs p16〕 |
| 推理:高交互 decode | 低批量、通信处在关键路径上 | 省掉电交换一跳:单级 EPS 事务 1,000 ns、两级 1,600 ns,其中带宽贡献仅 25 ns | 〔SalienceLabs p5–p6〕;512 XPU All-reduce 中,EPS 完成时间比 OCS 多约 58%–61%(读图)〔SalienceLabs p10〕 |
| 推理:TPU 8i | MoE 推理 | Boardfly:4 芯片 → 32 芯片组(铜)→ 36 组经 OCS 连成最多 1,024 颗活动芯片的 Pod,最坏跳数从 16 降到 7 | [W27] |
| 推理:LPU 流水线 | 数据逐芯片流过,路径固定 | 用 OCS 连大规模 LPU 集群 | [W22][W26] |
3.4 NVIDIA 和产业链怎么考虑
- NVIDIA 列出的四道门槛〔ECOC 0920-am-Su2-I-01-NVIDIA p18〕:
- 插损:当前路径至少经过 4 个面板连接器,DR4 只有 3 dB 余量,FR4 只有 4 dB。
- 成本:目标每 1RU 超过 256 个双工端口。
- 可靠性:不能劣化 BER/FEC 余量。
- 端口密度:每个机架需要上千个 OCS 端口。
- OFC 论文补充了取舍:WDM 可以提高 OCS 的有效端口数但会增加插损;双向传输在某些配置下会限制任意到任意的连接;固态集成 OCS 的插损更高,可能需要片上放大,从而增加复杂度、功耗与光损伤〔OFC M3F.6〕。
- iPronics 的回应:用硅光加 SOA 增益补偿损耗(增益 8–12 dB),与 Lumentum 1.6T 2×DR4 收发器联测,前置 BER 相对 1e-12 基线只劣化 1 个数量级(自称“业界首个”);切换时间 300 ps(器件级),系统重构为亚毫秒级;宣称比现有方案紧凑 20 倍、成本效益高 3–5 倍、约 100 美元/端口(自报)〔ECOC 0920-am-Su2-I-03-iPronics p11–p12〕〔ECOC 0921-Mo3-A1-iPronics p1, p14〕〔ECOC 0924-推定F4-iPronics p4, p21〕。
- 竞争格局:
- MEMS/3D 自由空间方案多为每 1U 32–40 端口,供应商包括 Coherent、Lumentum、Polatis、光迅/Triple-Stone(320×320)、Molex 等〔ECOC 0921-Mo3-A1-iPronics p2〕。The Register 称 Coherent 的 300 端口设备需要 8U 以上[W22]。
- 硅光与超快路线:Oriole Networks 宣称瓶颈在收发器的再锁定时间,其方案在 32,000 GPU 集群中把收发器总数从 196,608 个降到 32,768 个、网络功耗降 81%(自报)〔ECOC 0920-pm-Su3-A-04-OrioleNetworks p9, p12〕;Salience Labs 主攻 scale-up OCS。
3.5 需求真的会来吗
支持放量的证据:
- NVIDIA 已把 OCS 写进系统架构:OFC M3F.6 给出四层插入点,并投资专业 OCS 公司。
- Google 已有推理用 OCS 的产品:TPU 8i 的 Boardfly 拓扑。
- 推理负载有利于 OCS:Salience 与 The Register 都指出推理流量随部署静态,天然适合电路交换。
- scale-up 带宽与机架功率的增长让电交换机成为功耗与成本的大头。
制约因素:
- 硅光 OCS 的插损要靠 SOA 补,在大规模下的可靠性与 FIT 数据还没有公开。
- Salience 自己标注:全 OCS 的 scale-up 架构“需要 NPO/CPO”,带光链路的纯 EPS scale-up 交换要到 2027 年〔SalienceLabs p7〕。也就是说,scale-up OCS 的前提是 scale-up 先光学化。
- 软件栈(编排器、NCCL、SDN 控制器)还在开发中〔iPronics p3〕。
判断:
- 2026–2027 年:OCS 先在推理集群(LPU、TPU 8i 类)和“机架间扩展 scale-up 域”中试点,规模是数百到数千端口。
- 2027–2028 年:随着 NPO/CPO 进入 scale-up,扁平 OCS 拓扑具备条件,硅光 OCS 的端口数(iPronics 计划 2027 年推出 100 端口以上的芯片〔ECOC 0921-Mo3-A1-iPronics p10〕)和 SOA 可靠性是放量的前提。
- 需求会来,但它跟着 scale-up 光学化走,而不是跑在前面。
四、Slow & Wide:2026 年的风向、方案、优势与挑战
4.1 风向:从概念到有标准、有样机、有反对者
- 标准层面:2026 年 3 月,AMD、Broadcom、Meta、Microsoft、NVIDIA、OpenAI 成立 OCI MSA,3 月 11 日发布 200G OCI 线路接口规范 v1.0:一路 212.5 Gb/s 电信号映射为 4 个 53.125 GBd NRZ 光通道,用级联微环实现 DWDM,单纤双向(收发走不同波长组)[W19][W28]。LightCounting 统计 2026 年共有 6 个 MSA 在“囤积可互操作的选项”(XPO、CPX、400G Optics、OCI、SDM4 MCF、Expanded Beam),其中只有 OCI 是慢宽路线〔ECOC 0920-pm-Su3-I-02-LightCounting p9, p12〕。
- 会议层面:ECOC 2026 专门设了“Fast/Narrow or Slow/Wide?”Workshop,没有一家声称慢宽全胜。
- 押快窄:Applied Materials 的 Chris Cole 称“快窄是 400G 光学唯一现实的选项,慢宽是适合吸引 AI 融资的未来技术”〔ECOC 0920-pm-Su3-I-08-AppliedMaterials p12〕;Ciena 认为“动量仍在通道速率上,快窄仍是规模化的最短路径”〔ECOC 0920-pm-Su3-I-05-Ciena p10〕。
- 押慢宽:Lightmatter 称“快窄有天花板,慢宽没有——在 3D 时”〔ECOC 0920-pm-Su4-I-06-LightMatter p3, p15〕;Credo 自称唯一做完整宽并行光学栈的厂商〔ECOC 0920-pm-Su4-I-07-Credo p8〕。
- 中间派:LightCounting、Arista、OpenAI 认为取决于系统约束;HyperLight 认为两者都通向“快宽”〔ECOC 0920-pm-Su4-I-05-HyperLight p3〕。
4.2 主要方案
| 厂商/组织 | 方案 | 关键规格(口径) | 状态 | 来源 |
|---|---|---|---|---|
| OCI MSA | 4λ×53.125 GBd NRZ,单纤双向,外置激光器 | 每方向 212.5 Gb/s 原始速率,标称 200G 接口 | v1.0 规范已发布 | [W28]〔ECOC 0920-pm-Su4-I-02-OpenAI p13〕 |
| Lightmatter | Passage EVK50 / EVK100 / M1000 | EVK50:16λ 双向,每波 56G NRZ,每纤 800 Gbps,1 km,<3 pJ/bit(PIC + 激光器);EVK100:16×100G PAM4;Guide 激光器每芯片 128 个以上、64λ 以上 | M1000 已可提供(自报) | 〔ECOC 0920-pm-Su4-I-06-LightMatter p6, p10, p14〕 |
| Qualcomm × Lightmatter | P-CPO 光 I/O | OFC 2026 演示:每纤 1.6 Tbps,200 m,106G PAM4 × 16λ DWDM | 演示 | 〔ECOC 0920-pm-Su3-I-04-Qualcomm p6〕 |
| Credo | ZeroFlap 有源光缆(宽并行 VCSEL) | 30 m,线缆体积最多减 75%,MTBF 1 亿小时;光 mesh 约 4 pJ/bit,对比铜交换约 14–17 pJ/bit(自估模型) | 可插拔产品已认证 | 〔ECOC 0920-pm-Su4-I-07-Credo p3, p6〕 |
| Coherent | 低电流 VCSEL 阵列 / 梳状 DWDM | 106G VCSEL 1.2 pJ/b、128G 1 pJ/b(16 通道,2.047T,实测);NRZ 慢宽 VCSEL 0.75 pJ/b(投影);梳状硅光 0.369 pJ/b(建模) | 实测与投影并存 | 〔ECOC 0920-pm-Su4-I-04-Coherent p3–p6〕 |
| Xscape Photonics | COMBX 可编程多波长激光器 | 同一平台支持 CWDM4(20 nm)、LR4(4.5 nm)、CW-WDM(1 nm)栅格 | 产品化中 | 〔ECOC 0920-pm-Su4-I-08-XscapePhotonics p8〕 |
| Microsoft Research × MediaTek | MOSAIC microLED | 医用成像光纤上数百条低速通道,最远 50 m,功耗比激光光缆低约 50%;Computex 2026 展示 400G CPO | 目标 2027 年底商用 | [W29][W30] |
| Avicena | LightBundle microLED | 1 Tbps 评估套件,最多 335 条通道 × 3 Gbps,多芯光纤;ECOC 2026 演示基于 MPO 的可插拔连接器版本 | 评估套件已出货 | [W31] |
| NVIDIA | DWDM 路线图 | 起步 8λ DWDM 微环,50 Gbps PAM2,每纤 400G;硅光约 3.5–4 pJ/b(含激光器) | 路线图 | 〔ECOC 0920-am-Su2-I-01-NVIDIA p13〕 |
| OLIX | 以慢宽光互连连接推理芯片 | DX-1 计划 2027 年下半年 | 研发中 | [W16] |
4.3 核心优势(有数据支撑的部分)
- 省掉 DSP/FEC,时延低:单通道速率越高,SerDes、FEC 与时延负担越重。Lightmatter 给出 56G NRZ 约 1–2 pJ/bit、BER <1e-9 时基本不需要 FEC;112G PAM4 约 4–6 pJ/bit,需要 KP4 FEC;448G 需要更强的 FEC、时延更高。PCB 上的电互连距离从约 1 m(56G)缩到只能用 flyover 或 CPO(448G)〔ECOC 0920-pm-Su4-I-06-LightMatter p5〕。
- 光引擎边界的能效:Coherent 汇总的实测值在 0.9–1.2 pJ/b,建模值 0.369 pJ/b,并特别强调不同核算边界不能直接比较〔Coherent p5–p6〕。
- 用冗余提高可靠性:OpenAI 的对比表认为慢宽与快宽可以“用冗余路径降低等效失效率”;Credo 称廉价的备用通道可以无缝切换〔OpenAI p11–p12〕〔Credo p8〕。
- 规避电通道的物理墙:Arista 给出 448G 电接口的带宽需求:PAM4 约 112 GHz、PAM6 约 90 GHz、PAM8 约 75 GHz;超低损耗 PCB 在 112 GHz 约 2.1 dB/英寸〔ECOC 0920-pm-Su3-I-03-Arista p3〕。
4.4 挑战
- 反向齿轮箱会吃掉收益:今天的 ASIC 输出 200G PAM4,接慢宽光学要经过 PAM4 DSP 加反向齿轮箱。Arista、Ciena、Applied Materials 都指出这会削弱节能优势;Cole 的“唯一安慰”是它和全重定时 400G 的功耗相近〔Arista p6, p8〕〔Ciena p7〕〔AppliedMaterials p11–p12〕。原生收益要等 ASIC 集成 UCIe/OCI 接口(Ciena 的“Phase 2”),最终形态是光中介层(“Phase 3”)〔Ciena p7〕。
- 市场窗口:Cole 认为“200G 串行已在爬坡、标准已完成,4×50G 慢宽来不及”〔AppliedMaterials p3〕。
- 可靠性要靠现场数据:OpenAI 表示慢宽和快宽“需要现场验证”,快窄有可插拔选项、也有现场数据〔OpenAI p11–p12〕。
- 宽度难以回退:Ciena 指出宽度带来的封装面积、连接器和复杂度一旦选定难以回退,“慢宽等于押注单一技术”〔Ciena p4, p10〕。
- microLED 特有的问题:分析师提到色散限制距离、需要专用线缆与机架改造、缺少 MSA、业界若在 2027–2028 年转向 1.6T/3.2T 会遇到带宽天花板[W30]。
- 光纤与连接器的良率:EBO MSA 的数据是,1,088 个连接的板级光纤组装良率只有 23.0%,要把返修率压到 2% 需要单点失效概率约 7e-5〔ECOC 0922-MF-am-1220-EBOMSA〕。这对“宽”路线的影响尤其大。
4.5 本章判断
- 2026 年的风向是“对冲而非站队”:超大规模云厂商通过 OCI MSA 为慢宽留了选项,但量产主线仍是 200G/400G 快窄(XPO、NPO)。
- 慢宽最先落地的位置是 scale-up 的短距 GPU 链路和 scale-in(芯片到芯片、芯片到内存)。Marvell 把 uVCSEL/uLED I/O chiplet 列为 scale-in 的下一代〔ECOC 0920-pm-Su3-I-07-Marvell p4〕。可插拔主干网不会走慢宽。
- 要盯的指标:原生 OCI 接口 ASIC 的发布时间;OCI 链路的现场 FIT 数据;microLED 在 50 m 以内、800G 下的实际功耗与良率;OLIX DX-1 能否在 2027 年下半年按时交付。
五、Cerebras CS-4、OLIX 与光学晶圆级引擎(oWSE)
5.1 CS-3(WSE-3):核心优势与挑战
WSE-3 规格:TSMC 5 nm,4 万亿晶体管,90 万个 AI 核,44 GB 片上 SRAM,稀疏 FP16 算力 125 PFLOPS,内存带宽 21 PB/s,片上 fabric 26.8 PB/s,网络带宽 150 GB/s,功耗约 27 kW[W32]。
核心优势:整个模型的层都放在片上 SRAM,内存带宽(21 PB/s)比 HBM 高出数个数量级,所以解码时每用户 token 速率极高。OpenAI 就是看中这一点签下 750 MW 推理合同,报道明确提到用它的大容量 SRAM 加速推理[W14]。
挑战(按公开规格推导):
- 片上与片外带宽差了约 5 个数量级:片上 fabric 26.8 PB/s,对外网络只有 150 GB/s[W32]。模型一旦超出单晶圆,就要跨晶圆做流水线。
- 容量:单晶圆 44 GB SRAM。前沿 MoE 模型动辄数千亿到万亿参数,需要多晶圆切分。
- 供电与散热:单系统约 27 kW[W32]。
- 独立分析的质疑:SemiAnalysis 称 OpenAI 的 GPT-6.1 Sol Ultrafast 实际跑在 NVIDIA GPU 上而非 Cerebras[W33]。这是第三方说法,说明大合同的实际落地节奏值得观察。
5.2 CS-4 的重大更新
CS-4 于 2026 年 8 月 18 日在 Supernova 2026 发布,技术细节在 Hot Chips 2026 披露[W34][W35]。
| 项目 | CS-3 | CS-4 | 来源 |
|---|---|---|---|
| 晶圆 | 1 片 WSE-3 | 3 片 WSE-3T(Turbo),装在 Nexus 机架平台上 | [W32][W35] |
| 单晶圆算力 | 125 PFLOPS(稀疏 FP16) | 250 PFLOPS(时钟翻倍) | [W32] |
| 单晶圆内存带宽 | 21 PB/s | 43.2 PB/s | [W32] |
| 单晶圆 fabric | 26.8 PB/s | 53.5 PB/s(Cerebras 称是 Rubin NVL72 机架 NVLink 带宽 260 TB/s 的 200 倍以上) | [W32][W35] |
| 单晶圆对外网络 | 150 GB/s | 300 GB/s;晶圆间每片合计 2.4 Tb/s、时延 2 µs | [W32][W36] |
| 系统合计 | — | 750 PFLOPS、132 GB SRAM、7.2 Tb/s I/O、129.6 PB/s 内存带宽 | [W32][W34] |
| 核数 / SRAM / 工艺 | 90 万核 / 44 GB / 5 nm | 不变 | [W32] |
| 供电与散热 | 约 27 kW | 模块化“背包”:每个背包的供电与散热是 CS-3 的 2 倍、部件少 50%;AC/DC 转换器离晶圆约 0.5 mm;每背包最多 30 个风冷电源模块,277 V AC 输入、54.5 V DC 输出;每晶圆功耗约 54 kW(STH 推算) | [W35][W36][W32] |
| 性能 | — | 比 CS-3 快最多 2 倍;每用户 token 速率最多达 GPU 的 30 倍(自报) | [W34] |
5.3 CS-4 解决了什么,还剩什么
解决了:
- 单晶圆算力与带宽翻倍:时钟翻倍,工艺不变。
- 在机架内把三片晶圆当作一个系统:执行流水线化,把大流量的张量和专家通信留在晶圆内部,只让较小的激活数据跨晶圆[W35]。
- 供电与维护的工程瓶颈:模块化背包、干式快插阀、漏液与冷凝传感器,维护时不必排空冷却液[W35]。
仍然存在:
- 容量没变:每晶圆仍是 44 GB SRAM,整机架 132 GB[W32]。大模型仍要跨多个机架切分。
- 晶圆间仍是电互连:每晶圆 2.4 Tb/s[W36],与片上 53.5 PB/s 相比仍然差了几个数量级。Cerebras 的发布材料没有提到光学[W35][W36]。
- 路线图把容量问题交给了 CS-6:
- CS-5(2027 年,新 WSE 芯片):目标在开源模型上每用户每秒 1 万 token、每兆瓦每秒 300 万 token,支持 50 万亿参数以上的模型。
- CS-6:在晶圆级 SRAM 与计算之上 3D 叠 DRAM,2024 年开始研发,目标是占地缩小一个数量级[W35]。ECOC 讲稿中“CS-6 在 Hot Chips’26 发布”指的就是这一路线图预告〔ECOC 0921-Mo4-Cerebras p9〕。
5.4 光学晶圆级(oWSE):Cerebras 与其他玩家
Cerebras 自己的光学路线:联合创始人兼首席系统架构师 Jean-Philippe Fricker 在 ECOC 的题目是“Heterogeneous Hybrid Bonding: A Path to Wafer-Scale Optical Systems”〔ECOC 0921-Mo4-Cerebras〕:
- 堆叠结构为光学晶圆 / WSE / DRAM 三层〔p11〕。
- 电光转换在晶圆表面、靠近每个计算区域完成,再由低损耗波导把信号送到晶圆边缘,避免电信号跨晶圆传输带来的功耗与带宽密度限制〔p11〕。
- 列出五个设计维度:带宽密度(光 I/O 按晶圆边长算 BW/mm,电 I/O 按键合面算 BW/mm²)、激光器(集成还是外置)、面向键合通道重新优化的 SerDes、热兼容、可测试性与良率(“足够好的晶圆”策略、光测试接入、修复与冗余)〔p14〕。
- 讲稿全程没有给出带宽或功耗数值。这是方向性表态,还没有产品。
其他玩家:
| 玩家 | 方案 | 关键规格 | 核心优势 | 挑战 | 来源 |
|---|---|---|---|---|---|
| Lightmatter | Passage M1000 3D 光子中介层(“光子超级芯片”) | 最高 114 Tbps(Tx+Rx),1,024 个 SerDes,4,000 mm² 硅片复合体,34 个 chiplet,256 根光纤,供电密度 >1.4 W/mm²;同一光罩 2×4 步进拼接成一整张可编程光网络;每封装最多 1.5 kW | 用光网络实现冗余与可编程,突破 I/O 按周长增长的限制;仿真显示万亿参数 MoE 训练时间可降到铜方案的 0.37 倍 | 性能数据来自仿真;客户与量产规模未公开;融资 8.5 亿美元、估值 44 亿美元 | 〔ECOC 0924-推定F2-Lightmatter p2, p9, p16〕[W37] |
| Marvell(Celestial AI) | Photonic Fabric 光学 scale-up 互连 | 2026 年 2 月 2 日完成收购,约 32.5 亿美元,另有与营收挂钩的对价到 2029 财年 | 被大型芯片商整合,可直接进入定制 XPU 平台 | 整合进度与首批产品规格未公开 | [W38] |
| 台积电 | SoW-X 晶圆级系统 + COUPE 光引擎 | SoW-X:最多 16 颗满光罩 ASIC、80 个 HBM4、2,800 路 224G SerDes,裸片间带宽 260 TB/s;40 光罩版本规划在 2029 年;COUPE 从 2026 年起用于 CoWoS 上的 CPO | 代工厂级工艺与产能;NVIDIA CPO 已采用 COUPE | 光引擎与 SoW 的集成仍在路线图上;功耗在千瓦级 | [W39]〔ECOC 0920-pm-Su3-A-05-NVIDIA〕 |
| imec | 300 mm 晶圆级 SiN 波导 + D2W 键合 | 传播损耗 <0.15 dB/cm,间距 <6 µm;首个 300 mm 晶圆级光罩拼接互连波导;目标 <1 pJ/bit | 开放平台,可授权给多家使用 | 仍在工艺平台阶段 | 〔ECOC 0921-Mo12-A4-IMEC p14–p17〕 |
关于“oWSE/oPSE”:按你的 OFC 2026 论文索引的分类,它指晶圆级与 3D 光电集成。除上表外,OFC 2026 的两篇代表论文是:
- TFLN 电光调制器与驱动 EIC 晶圆级异质集成的 CPO 引擎,带宽超过 100 GHz(PDP)〔OFC Th4A.6〕。
- 3D 堆叠 7 nm EIC / 65 nm PIC 的 (8+1)×32 Gb/s DWDM 光 I/O,1.33 Tb/s/mm²(高分论文)〔OFC M4B.2〕。
5.5 OLIX「SRAM + 光」方案深度技术洞察
口径说明
OLIX 至今没有公开单芯片 SRAM 容量、工艺节点、代工厂、光互连带宽和功耗[W42]。本节分两类内容:
- 公开信息:来自公司发布和媒体报道,逐条标注来源。
- 推算:用已核实的同类方案(NVIDIA Groq 3 LPU、Cerebras WSE-3、OpenAI Jalapeño)和公开的工艺数据做数量级估算,都标为“推算”并写明假设。推算只用来说明约束在哪里,不是对 OLIX 真实规格的猜测。
5.5.1 方案到底是什么:电子计算 + 片上 SRAM + 光互连
媒体常称 OLIX 为“光子 AI 芯片”,也有报道用“光学张量处理单元(OTPU)”的说法[W42]。但多家报道对架构的描述是一致的:计算和存储在电子芯片上,光只负责芯片之间的连接[W43][W44][W45]。它不是用光做矩阵运算的“光计算”路线。
| 要素 | 公开信息 | 来源 |
|---|---|---|
| 公司 | 2024 年 3 月以 Flux Corp 成立,2026 年 1 月更名为 OLIX Computing;总部伦敦;员工 140 人以上,分布在布里斯托、多伦多、旧金山、奥斯汀;创始人 James Dacombe | [W42] |
| 融资 | 2026 年 2 月 2.2 亿美元(估值约 10 亿美元);8 月 3.12 亿美元 B 轮,投后估值 33 亿美元,Fundomo 领投,Arm、Hudson River Trading、Reed Hastings、英国主权 AI 基金参投;网络先驱 Nick McKeown 进入董事会 | [W42][W44] |
| 系统形态 | X-1 平台是整机架方案,把一个模型分摊到多颗“按阶段专用”的芯片上 | [W44][W45] |
| 首款芯片 | DX-1 专做 LLM 推理的 decode(解码)阶段;模型和 KV 缓存都放在片上 SRAM;不用 HBM,也不用先进封装 | [W43][W44] |
| 互连 | 自研“慢宽”光互连,芯片间直接用光传数据;采用 NRZ 编码(而不是 PAM4),以减少对信号处理的依赖;单条通道故障时有容错能力;最多可扩展到 10 万颗以上芯片 | [W43][W44] |
| 调度 | 确定性编译器在整个机架上排布负载 | [W44] |
| 性能宣称 | 1,000 亿参数模型每秒超过 1 万 token;多个 X-1 机架组成集群可运行 10 万亿参数模型 | [W43] |
| 时间表 | 2026 年晚些时候流片;首批客户试点与机架部署在 2027 年下半年(SiliconANGLE 一篇报道写的是 2027 年上半年,与其他信源不一致) | [W42][W43][W45] |
还没有公开的关键参数:工艺节点、代工厂、单芯片 SRAM 容量、芯片面积、光互连的波长数与每纤带宽、能效(pJ/bit)、整机架功耗、每 token 成本[W42]。
5.5.2 技术机理:为什么“SRAM 路线”必然要配“光互连”
这一节的三个推算,串起来说明了 OLIX 架构的内在逻辑。
(1) 容量:SRAM 装模型意味着要上百颗芯片(推算)
- SRAM 密度已经接近停滞:台积电 N5 与 N3E 的高密度 SRAM 位单元都是 0.021 µm²,N3E 密度约 31.8 Mb/mm²;N2 降到 0.0175 µm²,约 38 Mb/mm²[W46][W47]。
- 参照点:NVIDIA Groq 3 LPU 单芯片 500 MB SRAM(三星 4 nm),一个 LPX 机架 256 颗共 128 GB[W26];Cerebras 用整片晶圆也只有 44 GB[W32]。
- 推算:一个 1,000 亿参数模型,按 FP8 约需 100 GB、按 FP4 约需 50 GB 来存权重(尚不含 KV 缓存)。
- 按 Groq 3 的单芯片容量,需要约 100–200 颗芯片。
- 即便采用 N2 工艺、在一颗约 800 mm² 的芯片里拿一半面积做 SRAM,也只有约 1.9 GB(400 mm² × 38 Mb/mm²),仍需约 25–50 颗。
- 10 万亿参数模型(FP4 约 5 TB)则需要数千到上万颗。这与 OLIX“扩展到 10 万颗以上芯片”的宣称在数量级上一致。
结论:SRAM 路线把“内存容量问题”转化成了“芯片间互连问题”。模型被切得越碎,每个 token 要穿过的芯片就越多。
(2) 带宽:SRAM 让片内带宽过剩,瓶颈转到片间(推算)
- 在批量为 1 的解码中,每生成一个 token 都要把所有激活权重读一遍。
- 推算:一个 1,000 亿参数的稠密模型按 FP8 约 100 GB,要达到 1 万 token/s/用户,需要约 1 PB/s 的权重读取带宽。
- 分摊到 50–200 颗芯片,每颗约 5–20 TB/s。这对 SRAM 来说不难:Groq 3 单芯片 150 TB/s[W26]。作为对照,HBM 路线的 Jalapeño 单芯片 15.4 TB/s[W21]。
- 结论:SRAM 方案的内存带宽很充裕,真正的约束变成了芯片之间传激活值的时延。
(3) 时延预算:为什么是“慢宽 + NRZ”(推算)
- 1 万 token/s 意味着每个 token 只有约 100 µs。如果模型沿流水线切在约 100 颗芯片上,每一级(计算 + 传输)的预算只有约 1 µs。
- 已核实的对照数据:
- 高速 PAM4 链路需要 FEC:112G 用 KP4,448G 需要更强的 FEC、时延更高;56G NRZ 在 BER <1e-9 下基本不需要 FEC,约 1–2 pJ/bit〔ECOC 0920-pm-Su4-I-06-LightMatter p5〕。
- 即便是专为低时延设计的园区相干 FEC,也要 50–75 ns〔ECOC 0920-pm-Su4-A-04-Nokia p12〕。
- 经过一级电交换机的事务时间约 1,000 ns、两级约 1,600 ns〔ECOC 0922-PF-1155-SalienceLabs p5–p6〕。
- 结论:要把每一跳压到亚微秒、而且时延固定(确定性编译器需要可预期的时延),最直接的办法是芯片之间点对点直连、不经过交换机、用不需要 FEC 的 NRZ 低速多通道。这正是 OLIX 选的“慢宽 NRZ 光互连”。
(4) 为什么是光而不是铜:几百到上万颗芯片无法都放在铜的有效距离内。OpenAI 在 ECOC 给出的铜缆有效距离,200G/lane 约 1 m、400G 约 1 m〔ECOC 0920-am-Su1-B-02-OpenAI p4〕;Ciena 给出 200G 无源铜约 1.5 m〔ECOC 0920-pm-Su3-I-05-Ciena p10〕。慢宽光在保持低速简单调制的同时,把距离扩展到机架乃至机架之间。
一个容易被忽略的结构性优势:第四章提到,慢宽落地最大的障碍是今天的交换机和 GPU 输出 200G PAM4,要接 4×50G 光学就得加“反向齿轮箱”,这会吃掉大部分功耗收益〔ECOC 0920-pm-Su3-I-03-Arista p6, p8〕〔ECOC 0920-pm-Su3-I-08-AppliedMaterials p11–p12〕。OLIX 自己设计芯片,可以在芯片上直接做原生的慢宽 NRZ 光接口,天然绕开这个问题。这是它和“往现有 GPU 上加慢宽光模块”那类方案的根本区别。
5.5.3 与现有方案的对比
| 维度 | GPU / ASIC + HBM(Rubin、Jalapeño) | NVIDIA Groq 3 LPX(SRAM + 电互连) | Cerebras CS-4(晶圆级 SRAM) | OLIX X-1(SRAM + 慢宽光互连) |
|---|---|---|---|---|
| 权重存放 | HBM,如 Jalapeño 单芯片 216 GiB HBM4、15.4 TB/s[W21] | 片上 SRAM,单芯片 500 MB、150 TB/s;每机架 256 颗共 128 GB、40 PB/s[W26] | 晶圆上 SRAM,每晶圆 44 GB、43.2 PB/s;每机架 3 片共 132 GB[W32] | 片上 SRAM,容量未公开[W42] |
| 模型切分 | 少数芯片即可装下大模型 | 大量芯片分摊 | 少数晶圆分摊 | 大量芯片分摊(宣称最多 10 万颗以上) |
| 芯片间互连 | NVLink、以太网等,铜和光混合 | 未公开具体互连形态 | 晶圆内 fabric 53.5 PB/s;晶圆间每片合计 2.4 Tb/s(电)[W32][W36] | 自研慢宽 NRZ 光互连[W43] |
| 定位 | 训练 + 推理通用 | decode 专用,与 Rubin(prefill)配对[W26] | 推理为主 | decode 专用,按阶段拆分[W44] |
| 供应链依赖 | HBM + CoWoS 先进封装 | 不用 HBM | 晶圆级制造与封装(独家工艺) | 不用 HBM、不用先进封装[W43] |
| 性能宣称 | Jalapeño 在 gpt-oss-120B 上每千瓦吞吐是 GB200 的 1.9 倍[W21] | LPX + Rubin NVL72 在万亿参数模型上每兆瓦吞吐是 Blackwell NVL72 的 35 倍(自报)[W26] | CS-5(2027 年)目标 1 万 token/s/用户[W35] | 1,000 亿参数模型超过 1 万 token/s[W43] |
| 成熟度 | 量产 | 已全面量产,2026 年底前上线,Nebius 是首发客户[W26] | CS-4 已发布[W34] | 未流片,2027 年交付[W42] |
相对 HBM 路线的优势:
- 解码时延和每用户速度:SRAM 带宽比 HBM 高一个数量级以上,适合高交互、低批量的 decode。
- 绕开 HBM 与 CoWoS 产能:这两者是当前 AI 芯片最紧的供给约束,OLIX 把“不需要先进封装”作为核心卖点[W43][W45]。
- 架构顺应推理拆分的大方向:OpenAI 把一个请求拆成 prefill、draft、decode 三种硬件形态〔ECOC 0920-pm-Su4-I-02-OpenAI p4〕;NVIDIA 自己也用 LPU 做 decode、GPU 做 prefill[W26]。专用 decode 芯片的思路已被验证。
相对 HBM 路线的劣势:
- 容量效率低:同样一个模型要用多得多的芯片,芯片总面积、机架数和功耗随模型规模近似线性增长。
- 灵活性差:模型变大或上下文变长就要加芯片;HBM 方案可以在同一批芯片上换更大的模型。
- 只做 decode:prefill、训练仍要依赖 GPU,客户需要维护异构集群。
相对其他 SRAM 路线(Groq 3、Cerebras)的差异:
- 与 Groq 3 相比:两者都是“多芯片 SRAM + decode 专用”。OLIX 的差异在光互连,理论上能把芯片数扩展得更多、距离更远、每跳时延更低。但 Groq 3 LPX 已在量产、背后是 NVIDIA 生态,OLIX 在时间上落后约一年。
- 与 Cerebras 相比:Cerebras 用整片晶圆把大部分通信留在晶圆内部(53.5 PB/s),晶圆间只有 2.4 Tb/s;OLIX 用标准尺寸芯片加光互连,不依赖晶圆级制造,但每一跳都要经过光链路。两者在 2027 年的目标几乎相同(每用户 1 万 token/s)[W35][W43],会正面竞争。
5.5.4 能解决当前哪些挑战
- 解码阶段的“内存墙”:HBM 路线的每用户解码速度受限于 HBM 带宽,SRAM 把这个瓶颈移除了。
- HBM 与先进封装的供给瓶颈:不需要 HBM 和 CoWoS,可以用成熟的供应链扩产[W43]。
- Scale-up 的铜墙:200G 以上铜缆只有约 1–1.5 m,光互连让“一个模型分摊到上千颗芯片”在物理上可行。
- 互连时延与抖动:不经过交换机的点对点连接,加上不需要 FEC 的 NRZ,给确定性编译提供可预期的时延,这是长尾时延(尾延迟)稳定的前提。
- 慢宽落地的“反向齿轮箱”难题:自研芯片原生支持慢宽接口,不需要格式转换。
- 链路可靠性:多通道设计本身有冗余,单条通道故障可以容错[W43]。这回应了 OpenAI 对慢宽“需要可靠性证明”的关切〔ECOC 0920-pm-Su4-I-02-OpenAI p8〕。
5.5.5 面临的挑战
来自 SRAM 的挑战:
- SRAM 微缩已接近停滞:从 N5 到 N3E 完全没有缩小,N2 才缩小约 17%[W46][W47]。模型规模每年成倍增长,SRAM 容量却不会,所需芯片数只会越来越多。
- KV 缓存与并发用户数争夺同一块 SRAM(推算):以 Llama 2 70B 的公开结构(80 层、8 个 KV 头、head_dim 128)为例,每个 token 的 KV 缓存按 FP16 约 0.31 MiB。一个 4K 上下文的请求约 1.25 GiB,100 个并发用户就要约 125 GiB,与模型权重本身相当。OLIX 称 KV 缓存全部放在 SRAM 里[W43],那么长上下文、高并发就会直接转化为更多芯片。每用户速度很快,但每颗芯片能服务的用户数有限,每 token 成本是最大的问号。
- 利用率:按阶段拆分的专用芯片,要靠调度把 prefill 与 decode 的配比做对,负载变化时容易出现闲置。
来自光互连的挑战: 4. 制造、良率与封装:报道直接指出光子器件“出了名地难制造、难提良率、难规模化封装”[W42]。“不用先进封装”指的是不用 HBM 的 CoWoS,光引擎本身仍需要精密的光电封装。 5. 光纤与连接器的规模:几千到上万颗芯片的点对点光连接,光纤数量和连接器良率会成为量产瓶颈。EBO MSA 的数据是,1,088 个连接的板级光纤组装良率只有 23.0%〔ECOC 0922-MF-am-1220-EBOMSA〕。 6. 激光器与可靠性:多波长光源的寿命与失效率是慢宽方案的共性难题;OpenAI 要求用 FIT 置信上界评估,并需要现场数据〔ECOC 0920-pm-Su4-I-02-OpenAI p9–p12〕。 7. 私有互连与生态:OLIX 的光互连是自研的,而行业的开放慢宽规范是 OCI MSA(4×53.125 GBd NRZ)[W28]。私有方案性能可以做得更激进,代价是客户无法混用第三方部件。
来自商业与竞争的挑战: 8. 时间窗口:2026 年底才流片,2027 年交付[W42]。同一个细分赛道里,NVIDIA Groq 3 LPX 已全面量产并在 2026 年底前上线[W26],Cerebras CS-5 在 2027 年瞄准同样的 1 万 token/s/用户[W35]。 9. 软件与模型兼容:公司称可以兼容现有模型与软件栈、不需要重写[W42],但确定性编译器能否跟上前沿模型结构的快速变化(MoE、长上下文、推测解码),还没有公开验证。 10. 尚无产品:The Next Web 的评价是它“还不是产品,而是一个押注”,所有宣称都停留在融资材料上[W45]。
5.5.6 判断与观察指标
- 架构判断:OLIX 的方向(SRAM 放模型 + 慢宽光互连 + 按阶段拆分)在技术上自洽。每一个选择都针对一个真实的约束:内存墙、HBM 供给、铜墙、FEC 时延、反向齿轮箱。它是第一个把“慢宽光互连”作为系统核心、而不是附加部件的推理平台,对本文第四章“慢宽落地要靠原生接口”的判断是一个直接的验证机会。
- 核心风险:成败取决于“芯片数 × 光链路数”的成本曲线,而不是单芯片性能。SRAM 容量停滞意味着模型越大,这条曲线越陡。
- 要盯的指标:
- 2026 年底是否按时流片,以及公布的工艺节点和单芯片 SRAM 容量。
- 光互连的每纤带宽、pJ/bit 和链路 FIT 数据。
- 首个 X-1 机架能装下多大的模型、支持多少并发用户,以及每百万 token 成本(可与 NVIDIA 公布的 LPX 目标价每百万 token 45 美元对照[W26])。
- 首批客户名单:OpenAI、Microsoft 等 OCI MSA 成员是否在列。
5.6 本章判断
- CS-4 是“工程化升级”,不是“架构换代”:核数、SRAM、工艺都没变,收益来自时钟翻倍和三晶圆机架。真正的架构变化在 CS-5(新芯片)和 CS-6(叠层 DRAM)。
- 晶圆级系统最大的剩余瓶颈是“晶圆到晶圆”的带宽:片上与片外相差几个数量级。这正是光学晶圆级(Cerebras 光学晶圆、Lightmatter M1000、台积电 SoW-X + COUPE)要解决的问题。但目前只有 Lightmatter 给出了完整规格,Cerebras 还是方向性表态。
- 要盯的指标:CS-5 在 2027 年是否按时推出;CS-6 叠层 DRAM 的容量与带宽;Cerebras 是否在 CS-5 或 CS-6 中引入光学晶圆间互连;OpenAI 750 MW 合同的实际部署节奏。
六、跨专题总判断
- 三层同时在“光学化”,但节奏不同:
- scale-across 的线路系统(FST + 多 rail)在 2026–2027 年进入标准化与放量。
- scale-up 的光学(NPO/CPO、OCS、慢宽)在 2027–2028 年接力。
- 晶圆级光学(oWSE)在 2028 年以后。
- 推理正在重新定义互连:OpenAI 的“满足 SLA 时延下每瓦每秒请求数”、Salience 的“随负载静态”、NVIDIA 和 Groq 的 LPU 解码,都把低时延与确定性放到带宽之前,这对 OCS 和慢宽有利。
- 超大规模云厂商用“投资 + MSA”替代收购:NVIDIA 2026 年在光学上的公开投资至少有 Coherent、Lumentum、Marvell 各 20 亿美元,外加参与 iPronics 1.25 亿美元的轮次;OpenAI 靠 Broadcom 的 10 GW 合作和 OCI MSA 施加影响,没有收购光子公司。
- 可比性提醒:本文所有 pJ/bit、功耗降幅都是各家在不同核算边界下的自报、投影或建模值。Coherent 在 ECOC 上特别提醒了这一点〔ECOC 0920-pm-Su4-I-04-Coherent p5〕,使用时不要跨表横向比较。
参考来源
本地资料:ECOC 2026 讲稿笔记(〔ECOC …〕标注)、OFC 2026 论文全文(〔OFC …〕标注)、《全球 OCS 技术与产业》(2026-09-08,引用 Agrell 等《Roadmap on optical communications》2024)。
网络信源:
- [W1] Microsoft Fairwater 亚特兰大 + 威斯康星 AI superfactory 报道:https://www.techradar.com/pro/microsoft-unveils-its-first-ai-superfactory-heres-what-the-future-of-computing-will-really-look-like
- [W2] Microsoft 官方博客《Infinite scale: The architecture behind the Azure AI superfactory》(2025-11-12):https://blogs.microsoft.com/blog/2025/11/12/infinite-scale-the-architecture-behind-the-azure-ai-superfactory/
- [W3] NVIDIA Spectrum-XGS 发布(2025-08-22):https://nvidianews.nvidia.com/news/nvidia-introduces-spectrum-xgs-ethernet-to-connect-distributed-data-centers-into-giga-scale-ai-super-factories
- [W4] Broadcom Jericho4 发布:https://investors.broadcom.com/news-releases/news-release-details/broadcom-ships-jericho4-enabling-distributed-ai-computing-across
- [W5] Cisco 8223 / Silicon One P200:https://newsroom.cisco.com/c/r/newsroom/en/us/a/y2025/m10/cisco-sets-benchmark-with-industry-most-scalable-efficient-51-2t-routing-systems-for-distributed-ai-workloads.html
- [W6] EU AI Gigafactories(InvestAI):https://www.datacenterdynamics.com/en/news/eu-allocates-20bn-to-developing-four-ai-gigafactories/
- [W7] 中国 FNTF 投运:https://interestingengineering.com/ai-robotics/china-distributed-ai-supercomputer-network
- [W8] SCMP 对 FNTF 的报道:https://www.scmp.com/news/china/science/article/3335773/over-10-years-making-china-launches-2000km-wide-ai-computing-hub
- [W9] 中国数据中心项目汇总(阿里云 + 中国电信韶关):https://www.blackridgeresearch.com/blog/latest-list-top-largest-data-center-projects-china
- [W10] Ciena 2026 年第三季度财报电话会(RLS HyperRail 时间表):https://stocknow.ai/en/calls/hacg63079xnta6bjtky3aazr/cien_q3-2026-earnings-call
- [W11] Nokia 博客《When AI meets line systems: scaling faster with multi-rail OLS》:https://www.nokia.com/blog/when-ai-meets-line-systems-scaling-faster-with-multi-rail-ols/
- [W12] AMD 向 OpenAI 供应 6 GW:https://www.datacenterdynamics.com/en/news/amd-to-supply-openai-with-6gw-worth-of-gpus-plans-1gw-deployment-starting-in-2026/
- [W13] OpenAI × Broadcom 10 GW:https://www.cnbc.com/2025/10/13/openai-partners-with-broadcom-custom-ai-chips-alongside-nvidia-amd.html
- [W14] OpenAI × Cerebras 750 MW:https://www.hpcwire.com/aiwire/2026/01/14/cerebras-lands-major-openai-deal-to-scale-ai-inference/
- [W15] OLIX 2.2 亿美元融资(2026-02):https://www.datacenterdynamics.com/en/news/uk-chip-startup-olix-raises-220m-for-development-of-photonic-ai-chips-that-forgo-the-need-for-hbm-report/
- [W16] OLIX 3.12 亿美元 B 轮(2026-08-04):https://picmagazine.net/article/124984/OLIX_raises_312M_for_optical_AI_platform
- [W17] Crunchbase:OpenAI 2023–2026 年收购统计:https://news.crunchbase.com/ma/data-openai-2023-2026-acquisitions-open-source-astral-promptfoo/
- [W18] OpenAI 收购 Glass Imaging(2026-09):https://siliconangle.com/2026/09/14/openai-reportedly-buys-ai-camera-startup-glass-imaging-for-more-than-300m/
- [W19] OCI MSA 成立与规范:https://convergedigest.com/oci-msa-optical-scale-up-ai-clusters-outgrow-copper/
- [W20] TechCrunch:OpenAI 发布首款自研芯片(2026-06-24):https://techcrunch.com/2026/06/24/openai-unveils-its-first-custom-chip-built-by-broadcom/
- [W21] ServeTheHome:Hot Chips 2026 上的 OpenAI Jalapeño:https://www.servethehome.com/openai-jalapeno-asic-at-hot-chips-2026/
- [W22] The Register:NVIDIA 参与 iPronics 投资(2026-09-02):https://www.theregister.com/networks/2026/09/02/nvidia-joins-investment-into-ipronics-to-build-out-optical-circuit-switching-ocs-tech/5293764
- [W23] iPronics 1.25 亿美元融资:https://convergedigest.com/ipronics-raises-125m-silicon-photonics-ocs-ai-data-centers/
- [W24] NVIDIA 投资 Coherent 与 Lumentum(2026-03-02):https://www.cnbc.com/2026/03/02/nvidia-investment-coherent-lumentum.html
- [W25] NVIDIA 投资 Marvell(2026-03-31):https://nvidianews.nvidia.com/news/nvidia-ai-ecosystem-expands-as-marvell-joins-forces-through-nvlink-fusion
- [W26] NVIDIA × Groq 与 Groq 3 LPU:https://www.tomshardware.com/tech-industry/semiconductors/nvidias-20-billion-groq-deal-produces-its-first-chip
- [W27] Google TPU 8t / 8i 技术详解:https://cloud.google.com/blog/products/compute/tpu-8t-and-tpu-8i-technical-deep-dive
- [W28] OCI MSA 200G 线路接口规范 v1.0:https://oci-msa.org/assets/files/200G-OCI-Optical-Phy-Specification-v1.0.pdf
- [W29] MediaTek × Microsoft MOSAIC(Computex 2026):https://abit.ee/en/hard/mediatek-microled-optical-interconnect-cpo-data-centre-computex-2026-microsoft-research-mosaic-400-g-en
- [W30] Network World:Microsoft MOSAIC(2026-03-18):https://www.networkworld.com/article/4146960/microsofts-laser-free-cable-tech-promises-to-slash-ai-data-center-networking-power-bills.html
- [W31] Avicena 在 ECOC 2026 演示可插拔 microLED 互连:https://www.semiconductor-today.com/news_items/2026/sep/avicena-170926.shtml
- [W32] ServeTheHome:WSE-3 Turbo 与 CS-4:https://www.servethehome.com/cerebras-intros-faster-wse-3-turbo-processor-and-first-rack-scale-cs-4-system/
- [W33] SemiAnalysis 关于 GPT-6.1 Sol Ultrafast 运行平台的说法(转述):https://officechai.com/ai/openais-gpt-6-1-sol-ultrafast-is-not-running-on-cerebras-but-on-nvidia-gpus-says-semi-analysis
- [W34] Cerebras 发布 CS-4(2026-08-18):https://investors.cerebras.ai/news-releases/news-release-details/cerebras-unveils-cs-4-30-times-faster-gpu-based-solutions
- [W35] Cerebras 博客:Hot Chips 2026 技术详解:https://www.cerebras.ai/blog/ultrafast-frontier-inference-cerebras-deep-dive-at-hot-chips-2026
- [W36] ServeTheHome:Cerebras 在 Hot Chips 2026 谈机架级扩展:https://www.servethehome.com/cerebras-talks-going-rack-scale-with-their-wses-at-hot-chips-2026/
- [W37] Lightmatter 发布 Passage M1000 / L200:https://www.datacenterdynamics.com/en/news/lightmatter-unveils-m1000-and-l200-passage-photonic-interconnects/
- [W38] Marvell 完成收购 Celestial AI:https://www.sdxcentral.com/news/marvell-completes-325b-acquisition-of-photonic-startup-celestial-ai/
- [W39] 台积电 A14 与 SoW-X:https://www.networkworld.com/article/3969586/tsmc-targets-ai-acceleration-with-a14-process-and-system-on-wafer-x.html
- [W40] OLIX DX-1 性能报道(二手):https://enterprisedna.co/resources/news/olix-312m-photonic-ai-chips-enterprise-inference-august-2026/
- [W41] OpenAI 与 NVIDIA、AMD 等的算力合作汇总:https://www.ciodive.com/news/openai-amd-gpu-infrastructure-partnership-coreweave-oracle-nvidia/802163/
- [W42] RCR Tech:OLIX 放弃 HBM 与铜互连,对标 NVIDIA(公司背景、时间表与风险):https://rcrtech.com/semiconductor-news/olix-nvidia-by-ditching-hbm-and-copper/
- [W43] SiliconANGLE:OLIX 3.12 亿美元融资与 DX-1、X-1 架构(2026-08-03):https://siliconangle.com/2026/08/03/netflix-co-founder-backs-312m-round-optical-inference-appliance-maker-olix/
- [W44] Converge Digest:OLIX 光子推理平台与 Nick McKeown 入董事会:https://convergedigest.com/olix-raises-312m-photonic-ai-inference-nick-mckeown/
- [W45] The Next Web:OLIX B 轮与“这是一个押注”的评价:https://thenextweb.com/news/olix-312m-series-b-3-3bn-uk-optical-ai-chip-nvidia-rival
- [W46] Tom’s Hardware:台积电 3 nm SRAM 不再微缩:https://www.tomshardware.com/news/no-sram-scaling-implies-on-more-expensive-cpus-and-gpus
- [W47] Tom’s Hardware:台积电 2 nm SRAM 密度改进:https://www.tomshardware.com/tech-industry/sram-scaling-isnt-dead-after-all-tsmcs-2nm-process-tech-claims-major-improvements