本地原文:ECOC 2026 with Claude/ECOC2026_Insight_Report/OpenAI-Jalapeño推理芯片规格-深度分析-v1.md(v1.1)。厂商索引:AIDC 客户 · OpenAI

2026-10-06|v1.1 新增 §9:全局域 2,048 颗的 8 rail 组网推演|依据:ECOC 2026 现场 OpenAI 三份讲稿(本地)、Hot Chips 2026 公开披露、分析机构报道

来源标记:

  • 【官方】OpenAI、Broadcom 发布或 Hot Chips 2026 讲稿;
  • 【机构】SemiAnalysis、The Register、ServeTheHome 等第三方报道,可能含其自身推断;
  • 【本地】ECOC 2026 现场讲稿;
  • 【推算】本文根据上述数据计算,非披露值。

0. 一句话结论

Jalapeño 是一颗按”解码时延”设计的推理芯片。设计取舍可以概括为三点:

  • 带宽重于算力: 同功耗下,HBM 带宽约为 GB300 的 3.9 倍,FLOP/Byte 只有 GB300 的一半左右。
  • 本地内存重于全局共享: 64 个 core slice 各有一片 HBM,切片之间走专用 collective 网络。
  • 以太网 scale-up 重于私有协议: 128 颗芯片用 TH6 单跳互联;2,048 颗分两级、走 8 个 rail。

三家的分工如下:

  • OpenAI:架构、软件栈,以及 AI 辅助设计;
  • Broadcom:芯片实现、SerDes/IO、HBM PHY、TH6 交换芯片;
  • Celestica:板卡、托盘、机架、系统集成与量产。

1. 时间线

时间事件来源
2025-10OpenAI 与 Broadcom 签约,合作 10 GW 定制加速器及 Broadcom 网络,2026 下半年起部署【官方】
2025-11计算 die 流片(CoWoS 设计)。从 RTL 到流片约 9 个月【机构】SemiAnalysis;“9 个月”为【官方】
2026-06-24正式发布 Jalapeño,OpenAI 称之为”第一颗 Intelligence Processor”。工程样片已达到量产目标频率和功耗【官方】
2026-08Hot Chips 2026 完整披露。A0 硅片运行于 1.70 GHz,目标 1.80 GHz;B0 stepping 在 fab 中,能效约 +25%【官方】+【机构】
2026-09-20ECOC 2026 上,OpenAI 两场讲 scale-up 系统与性能曲线,一场讲铜互连【本地】
2026 年底首批生产部署【官方】
2027逐步爬坡,大部分产出集中在 2027 年底【机构】SemiAnalysis

2. 芯片级规格总表

项目数值来源 / 置信度
定位LLM 推理专用;不做 PD 分离,prefill 与 decode 在同一套硬件上混跑【官方】
工艺计算 die:TSMC N3P;IO chiplet:N3E【机构】SemiAnalysis
计算 die单颗、接近 reticle 极限(约 800 mm² 级);确切面积未披露【官方】“reticle-sized”;面积为【推算】
封装CoWoS 类 2.5D:计算 die、IO chiplet 和 HBM4 同封装【机构】
主频A0 为 1.70 GHz,目标 1.80 GHz【官方】
MXFP4 稠密算力13.4 PFLOPS【官方】
MXFP8 算力3.4 PFLOPS(为 FP4 的 1/4,而不是常见的 1/2,说明阵列明显偏向 FP4)【官方】;解读为【推算】
其他精度64-bit 标量核,FP32/INT32 向量核【机构】
计算组织空间架构(spatial / NUMA 式):64 个 core slice,每个含 tensor(权重驻留脉动阵列)、SIMD 和标量引擎;乱序核加 L1 cache,不用软件管理的 scratchpad,以减少 barrier 等固定开销【本地】A1 p6;【官方】;【机构】
片上 SRAM”大容量 SRAM”,用于把中间结果和部分 KV cache 留在片上;容量未披露【机构】The Register
HBMHBM4,216 GiB,约 6 堆 × 12-Hi × 36 GB;供应商为 Samsung容量为【官方】;堆叠为【机构】Register;供应商为【机构】SemiAnalysis
HBM 带宽15.4 TB/s;pin 速率 10 Gb/s(Rubin 为 9.6 Gb/s)带宽为【官方】;pin 速率为【机构】
内存组织每个 core slice 对应一片 HBM,有低时延的本地视图;slice 之间用专用的高带宽 collective 网络,另有通用 NoC【本地】A1 p6;【官方】
TDP700 W【官方】
对外 IO32 条 200G SerDes(位于 N3E IO chiplet):24 条用于本地 scale-up(4.8 Tb/s,即 600 GB/s 单向),8 条用于全局 scale-up(1.6 Tb/s,即 200 GB/s)600/200 GB/s 为【官方】;lane 拆分为【机构】,并经【推算】自洽验证(见 §4.1)
Host 接口PCIe Gen5 连接 x86 主机(AMD EPYC Turin)【机构】
scale-up 协议以太网(scale-up Ethernet bridge 在芯片上),不是 NVLink 或 UALink 私有链路【本地】A1 p6–p7

2.1 自洽性检查【推算】

HBM 带宽:

  • HBM4 为 2048-bit 接口,10 Gb/s × 2048 ÷ 8 ≈ 2.56 TB/s 每堆;
  • × 6 堆 = 15.4 TB/s,与官方值完全吻合。
  • 因此”6 堆 HBM4 @10 Gb/s”基本可以确认。

HBM 与 slice 的对应:

  • HBM4 每堆 32 个通道,6 堆共 192 个通道;
  • 192 ÷ 64 slice = 3 通道 / slice;
  • 每个 slice 约 3.4 GB 容量、约 240 GB/s 带宽。
  • 这和”每个 slice 一片 HBM”的描述吻合。

每 slice 算力:

  • 13.4 PF ÷ 64 ÷ 1.7 GHz ÷ 2 ≈ 6.2 万 FP4 MAC/周期;
  • 量级相当于每个 slice 有 3–4 个 128×128 的 FP4 阵列。

3. 与主流加速器的对比

数据口径: 单芯片公开规格,取近似值。NVIDIA 的 FP4 为稠密值;Rubin 的 50 PF 为 NVIDIA 公布的推理 NVFP4 口径,训练口径约 35 PF。

指标JalapeñoGB200(B200)GB300(B300)Vera RubinTPU v7 Ironwood
工艺N3PN4PN4PN3PN3 级
FP4 PFLOPS13.4101550(35)—(FP8 4.6)
HBM216 GB HBM4186 GB HBM3E288 GB HBM3E288 GB HBM4192 GB HBM3E
HBM 带宽(TB/s)15.488227.4
TDP(kW)0.701.21.4约 1.8约 1
scale-up 单向带宽600 GB/s 本地 + 200 GB/s 全局900 GB/s900 GB/s1.8 TB/sICI
scale-up 域128(一跳)/ 2,048(两级)727272(144 die)9,216(3D torus + OCS)

3.1 归一化后的设计倾向【推算】

每千瓦(芯片 TDP)JalapeñoGB300Rubin解读
FP4 PF / kW19.110.7约 27.8(19.4)算力 / W 介于 Blackwell 与 Rubin 之间
HBM TB/s / kW22.05.712.2核心差异: 带宽 / W 是 GB300 的 3.9 倍、Rubin 的 1.8 倍
HBM GB / kW309206160每瓦可放更多 KV cache
FLOP / Byte8701,8752,270(1,590)越低越适合 decode(带宽受限)

结论: Jalapeño 不追峰值算力,而是用 700 W 换来接近 Rubin 一级的 HBM4 带宽。

LLM decode 每生成一个 token,都要把激活参数和 KV 从 HBM 读一遍,所以 FLOP/Byte 在 1,000 以下的芯片更”吃得饱”。这和它在高交互区(每用户 tokens/s 高、batch 小)大幅领先 GB300 的曲线相互印证(§5)。


4. 系统级:从托盘到 2,048 颗 pod

4.1 机架构成

层级构成来源
ASIC 托盘(“Vindaloo”)8 颗 Jalapeño / 托盘【本地】Su1-B-02 p7(16 托盘 × 8);【机构】
ASIC 机架16 个 Vindaloo + 8 个交换托盘(“Chana”:6 个本地、2 个全局),共 128 颗【机构】SemiAnalysis;128 为【官方】
背板机架内无源铜缆背板(类似 NVIDIA Oberon),约 6,144 对差分线【本地】Su1-B-02 p7;【机构】
Host 机架(“Katsu”)16 个 host 托盘,每托盘 2 颗 AMD EPYC Turin 与 1.5 TB DRAM;前端网络 2×200G;以 8 根外部 PCIe DAC 连接 ASIC 机架【机构】
功耗ASIC 机架约 130 kW;host 机架按 50 kW 配置、实际约 31 kW;合计约 160 kW,相当于”双宽 GB300 机架”【机构】
冷却130 kW 机架只能用液冷,官方未明说【推算】

本地域连接自洽验证【推算】:

  • 128 颗 × 24 条本地 lane = 3,072 条 200G lane;
  • 6 颗 TH6 × 512 条 200G 端口 = 3,072 条,完全相等;
  • 即每颗 Jalapeño 向 6 颗 TH6 各出 4 条 lane(每个平面 800 Gb/s),构成单跳、无收敛的 6 平面全互联;
  • 3,072 条 lane × 收发 2 对 = 6,144 对差分线,与 SemiAnalysis 的”6,144 DPs”一致。

功耗拆分【推算】:

  • 芯片 128 × 0.7 kW = 89.6 kW,约占 ASIC 机架的 69%;
  • 其余约 40 kW 为 10 颗 TH6、HBM 外的板级器件、电源损耗和风扇泵等;
  • 含 host 后约 1.26 kW / 颗;GB300 NVL72 约 1.9 kW / GPU(Grace 已计入)。

4.2 两级”半扁平”scale-up

本地域(单机架 128 颗):

  • 每颗 600 GB/s;一跳 TH6;
  • 张量并行放在这一级。
  • SemiAnalysis 称从 TP8 扩到整机架 TP32 仅用 8 天。

全局域(16 机架 2,048 颗):

  • 每颗 200 GB/s;8 个 rail(rail 0…7,对应每颗芯片的 8 条全局 lane);
  • 跳数为两级 Clos;
  • 专家并行、跨机架的 KV 传递和 DP 放在这一级。【本地】A1 p7;【官方】

全局级拓扑重建【推算】(v1.1 修订,依据 ECOC A1 p7 拓扑图;完整推演见 §9):

图上的两级交换分别是本地 TH6(上)和 rail TH6(下),Jalapeño 夹在中间、双归属。这就是”半扁平”的含义:

  • 标准两级 Clos 是”节点 → leaf → spine”;
  • 这里节点同时直连两级交换,省掉 leaf↔spine 这一层链路。

rail 映射(按 16 托盘 × 8 推断):

  • 托盘第 k 个槽位的芯片接 rail k;
  • 每个 rail 有 16 机架 × 16 托盘 = 256 颗;
  • 每颗把 8 条全局 lane 拆成 4 × 2 条,分别接本 rail 的 4 颗 TH6;
  • 每颗 TH6 = 256 颗 × 2 条 = 512 端口,正好用满。

全局 TH6 数量:

  • 8 rail × 4 = 32 颗(16,384 个 200G 端口);
  • 合每机架 2 颗,对应 2 个全局交换托盘各 1 颗;
  • SemiAnalysis 说”每托盘 2 颗(potentially)“,若属实则为 64 颗,但端口会有一半空闲或用于 rail 内互联。

整个 pod: 本地 96 + 全局 32 = 128 颗 TH6,每颗 Jalapeño 占 32 个 200G 交换端口。

跨机架链路:

  • 每机架 1,024 条全局 lane 中,约 1/16 落在本机架的 rail TH6 上;
  • 实际跨机架约 960 条 × 200G;整个 pod 约 15,360 条(约 3.07 Pb/s);
  • 若全部用 800G 光:约 3,840 条链路,7,680 只模块,每颗约 3.75 只 800G;
  • SemiAnalysis 提到”铜背板与光配线(patch panel)混合”,实际光 / 铜比例未披露。

4.3 2,048 颗 pod 的总量

项目数值来源
MXFP427 EFLOPS【官方】
HBM 容量432 TiB【官方】
HBM 带宽32 PB/s【官方】
功耗(含 host)约 2.6 MW【推算】160 kW × 16

5. 性能:厂商自报数据汇总

对比模型结果来源
对 GB200(1.2 kW)GPT-OSS-120B峰值混合 tokens/s/kW 为 1.9×;端到端时延低 1.7×;最高吞吐点约为 GB200 的 2 倍;并发为 1 时约 50×【官方】Hot Chips;【机构】
对 GB300(1.4 kW)DeepSeek-R1峰值效率 1.7×;端到端时延低 3.6×【官方】Hot Chips
对 GB300 MTPECOC 现场曲线最小请求时延 1.65 s 对 3.69 s(约 2.2×);同为约 10,500 tokens/s/kW 时时延低约 1.8×;约 200 tok/s/user 时效率约 9,000 对 1,500(约 6×);GB300 MTP 在约 330 tok/s/user 时达到上限,Jalapeño 可达约 700【本地】A1 p8(读图)
对所有对手Kimi K2.5约 700 tok/s/user;在 100 tok/s/user 时为次优芯片的 9 倍以上【机构】SemiAnalysis(数据由 OpenAI 提供)
对 Vera RubinTCO每美元输出 token 数”基本持平”【机构】SemiAnalysis
成本—每推理 token 成本约为 NVIDIA GPU 的 50%【机构 / 媒体】,未经独立验证

注意事项:

  1. 所有数据均由 OpenAI 提供,尚无独立第三方实测。SemiAnalysis 特别说明,其偏好的长上下文基准 AgentX 还没有 Jalapeño 的结果。
  2. 关于推测解码,各方说法不一致:
    • STH 记录 Hot Chips 讲稿中有”8 个输出 token / 1 次大模型前向”的推测解码;
    • SemiAnalysis 称部分图表中 Jalapeño 未用 MTP,而对手用了 MTP;
    • 可能是不同图表口径不同,需对照原始讲稿。
  3. 对比对象是 Blackwell 一代;与同为 HBM4 的 Rubin 相比,TCO 大致相当,优势不再是数量级。

5.1 为什么 700 tok/s/user 可行,以及互连为什么关键【推算】

以 Kimi K2.5 类 MoE 为例:约 1T 总参数,约 32B 激活参数,61 层。

带宽侧:

  • 每 token 读激活权重:FP4 约 16 GB;
  • TP32 下聚合 HBM 带宽 32 × 15.4 ≈ 490 TB/s;
  • 仅读权重的上限约 3 万 tok/s,带宽不是瓶颈。

通信侧:

  • 700 tok/s/user,意味着每 token 约 1.4 ms;
  • 61 层 × 每层约 2 次集合通信(TP all-reduce 与 EP all-to-all)≈ 120 次;
  • 每次集合通信的预算约 10 µs 量级,其中还要扣掉计算。

含义:

  • 在高交互区,时延主要由 scale-up 网络的跳数、SerDes / FEC 时延和抖动决定。
  • 这正是 OpenAI 在 ECOC 上反复强调”按时延和可靠性选互连”的原因:本地单跳 TH6 是 Jalapeño 曲线能够延伸到约 700 tok/s/user 的前提。

5.2 容量侧:适合 Agent 长上下文【推算】

  • 单机架 HBM: 128 × 216 GB ≈ 27.6 TB。
  • 权重: 1T 参数 FP4 加缩放因子约 0.55 TB,只占约 2%。
  • KV cache: MLA 类 KV 约 70 KB/token,余量约可容纳 3.8 亿 token。
  • 折合: 约 3,000 个 128K 上下文的并发会话。
  • 含义: “不做 PD 分离、prefill 与 decode 混跑”有容量基础。这也呼应了多 Agent 场景对 KV 命中率 ≥95% 的需求(见 AI 数据中心布局与训练推理流量调度)。

6. 三方分工

角色具体内容来源
OpenAI架构定义(spatial / NUMA、slice-HBM 本地化、collective 网络);用 XLS HDL 写 RTL;AI 辅助设计(内部模型与 Codex,SIMD 面积 −8%、矩阵引擎面积 −10%);性能模拟器 chilisim(误差 <5%);内核语言 Gluon(基于 Triton,以 linear layout 为核心抽象);推理引擎 Teacup;在硅片上 3 个月完成模型 bring-up【官方】+【机构】
Broadcom物理实现与后端;N3E IO chiplet(200G SerDes、HBM4 PHY);CoWoS 封装协调;TH6 交换芯片;10 GW 框架下的网络(scale-up 与 scale-out)【官方】+【机构】
Celestica板级、机架级与系统集成: ASIC 托盘、交换托盘、host 机架、铜背板、供电与液冷集成;高性能网络(交换托盘基于 TH6);可量产的生产体系(ODM/EMS 制造与测试);SemiAnalysis 原话为”系统级设计与 Celestica 合作完成”【官方】发布稿;【机构】

为什么是 Celestica(背景判断):

  • 它长期是 Broadcom Tomahawk 系列白盒交换机(如 TH5/TH6 参考设计)的主要 ODM,也是北美超大规模厂商 AI 机架和交换机的核心代工方。
  • TH6 交换托盘、铜背板机架和大功率液冷这三件事,都在它的现有能力圈内。
  • 有媒体称 Jalapeño 机架”直接部署到 Microsoft Azure 数据中心”,来源质量较低,未能证实。

7. 对光互连的启示

1. 当前一代:机架内全铜,光只在跨机架一级。

  • 本地 3,072 条 200G lane 全部为无源铜背板。【本地】Su1-B-02:200G/lane 铜缆约 1 m 可达。
  • 光的机会在全局一级:按 §4.2 的上限估算,约每颗 3.75 只 800G,每 pod 约 7,680 只。

2. 下一代:400G/lane 时铜会撞墙。

  • Su1-B-02 指出,400G/lane 时铜缆可达仅约 1 m,且需要更强 FEC,带来时延。
  • 若下一代 Jalapeño 把本地 lane 升到 400G,或把本地域扩到多机架,机架内也会转向 OCI / NPO / XPO。OpenAI 在 A1 讲稿给出的选型顺序是:时延 → 可靠性(FIT)→ 功耗 → 成本。

3. 规模量级【推算,上限情景】:

  • 10 GW ÷(约 1.26 kW / 颗 × PUE 1.2)≈ 660 万颗(假设全为 Jalapeño 这一代;实际为多代混合);
  • 每 GW 约 66 万颗,约 320 个 pod;
  • 若跨机架全光,约 250 万只 800G 等效模块 / GW。
  • 这是 OpenAI 自研路线给以太网 scale-up 光学带来的增量市场上限,实际取决于跨机架的铜 / 光比例。

4. 以太网 scale-up 得到实证。

  • Jalapeño 是继 Google TPU(ICI 加 OCS)之后,又一个不用 NVLink 的大规模 scale-up 系统,而且直接基于商用 TH6。
  • 这对 ESUN、SUE、OCI-MSA 等开放以太网 scale-up 生态是一次强背书。

8. 未披露或待核实

  • 计算 die 的确切面积、SRAM 容量、core 微架构细节(阵列尺寸、向量宽度);
  • HBM4 的堆数与堆高(6 × 12-Hi 为 Register 的推断);封装形式(CoWoS-L 还是 CoWoS-R);
  • 冷却方式、单机架重量,以及 host 与 ASIC 机架的物理布置;
  • 全局一级的实际光 / 铜比例,以及是否使用 OCS(SemiAnalysis 提到 optical patch panel);
  • 推测解码的口径不一致,见 §5 注意事项第 2 条;
  • 单价、良率与 2027 年出货量(SemiAnalysis 付费内容);
  • 下一代(multi-generation platform)的路线。

9. 全局域 2,048 颗:两层组网与 8 rail 推演【推算】

官方只给出三条: 128 / 2,048 颗;“半扁平”两级 Clos;全局 8 个 rail,每颗 200 GB/s。 接线方式和 TH6 用量都是本节根据 ECOC A1 p7 拓扑图(即 Hot Chips 2026 讲稿第 6 页)推演的结果。

9.1 拓扑图读法

来源:ECOC 2026 现场|OpenAI 0920-pm-Su3-A-02 p7(即 Hot Chips 2026 讲稿第 6 页)

A1 p7 右图从上到下分三层:

  • 上层: “Local domain: 128 Jalapeños”,接 Broadcom TH6(画成叠放的多颗);
  • 中层: Jalapeño 芯片,图上画为辣椒图标;
  • 下层: “Global domain: 2048 Jalapeños”,接 TH6 rail 0、rail 1 …… rail 7。

连线方式:

  • 本机架各芯片分别连到不同 rail;
  • 右侧虚线框代表其他本地域,它们的连线也汇入同一组 rail。

图注:

  • “Half flattened” two-level Clos topology;
  • Higher bandwidth for tensor parallelism / Lower bandwidth for expert parallelism / Low latency for both。

9.2 两层怎么组:芯片同时直连两层交换

            [本地 TH6 ×6]      ← 每颗 24×200G(600 GB/s),机架内一跳
                  │
     Jalapeño ×128 / 机架      …… ×16 机架
                  │
   [rail0][rail1] … [rail7]    ← 每颗 8×200G(200 GB/s),跨机架一跳

为什么叫”半扁平”:

  • 标准两级 Clos 是”节点 → leaf → spine”,所有跨 leaf 流量都走 leaf↔spine 链路。
  • 这里两级交换都直接接芯片:本地 TH6 相当于 leaf,rail TH6 相当于 spine。
  • 芯片本身充当 leaf 的上行口,省掉了 leaf↔spine 这一层链路。

路由:

通信对路径交换跳数
同机架本地 TH61
跨机架、同 railrail TH61
跨机架、不同 rail本地 TH6 → 本机架接目标 rail 的芯片中转 → rail TH6;或反向2,中间经过一颗芯片转发(类似 NCCL PXN)

与并行方式对应:

  • 张量并行放在机架内,一跳、600 GB/s;
  • 专家并行的 all-to-all 分两段:先在机架内重排(带宽充足),再走 rail 跨机架;
  • 任意两颗芯片之间最多两跳交换。
  • 机架内带宽是全局的 3 倍,所以中转一跳的代价不大。

9.3 8 个 rail 怎么组

主方案:托盘槽位映射 rail,与”16 托盘 × 8”吻合

  • 每个托盘第 k 个槽位的芯片接 rail k(k = 0…7),类似英伟达”服务器内第 k 张 GPU 接 rail k”的做法。
  • 每个 rail 的芯片数 = 16 机架 × 16 托盘 = 256 颗;带宽 256 × 1.6 Tb/s = 409.6 Tb/s,需要 4 颗 TH6。
  • 每颗芯片把 8 条全局 lane 拆成 4 组 × 2 条,分别接本 rail 的 4 颗 TH6,形成 4 个平面。
  • 同 rail 任意两颗芯片在 4 个平面上都一跳可达,合计 1.6 Tb/s。
  • 每颗 rail TH6:256 颗 × 2 条 = 512 个 200G 端口,正好满配。

两种不成立的接法:

  • 每颗用一个 1.6T 端口整口接一颗 TH6: 每颗 TH6 只能接 64 颗,rail 会被切成 4 个互不相通的 64 颗小组。
  • 第 k 条 lane 接 rail k(每颗都上全部 8 个 rail): 每个 rail 要 2,048 个端口,单颗 TH6 放不下,同样被切成互不相通的小组。可能性较低。

9.4 TH6 用量

层级TH6 数量200G 端口校验
本地层6 / 机架 × 16 = 9649,152128 × 24 = 3,072 = 6 × 512
全局 rail 层8 rail × 4 = 32(约每机架 2 颗)16,3842,048 × 8 = 16,384 = 32 × 512
合计12865,536每颗 Jalapeño 占 32 个交换端口

与 SemiAnalysis 的出入:

  • SemiAnalysis 写的是每机架 2 个全局交换托盘、每托盘”potentially”2 颗 TH6,合 64 颗,是本推演的 2 倍。可能的解释有三种:
    1. 每托盘实际只有 1 颗,正好对上 32 颗;
    2. 多出的一半端口用于同一 rail 内交换机之间的互联,也就是在 rail 内部再做一层扁平互联;
    3. 冗余或预留端口。
  • 本地层的 6 颗 / 机架与 SemiAnalysis 的”6 个本地交换托盘”一致。

与标准 Clos 的对比:

  • 用无阻塞两层 Clos 连接 16,384 个端口,需要 64 颗 leaf(256 下 / 256 上)加 32 颗 spine,共 96 颗,任意两颗芯片都是 2 跳。
  • 半扁平方案全局层只用 32 颗,交换芯片和跨机架光链路都省掉约 2/3。
  • 代价是跨 rail 通信要经过一颗芯片中转。

9.5 跨机架链路与光模块

项目数值
每机架全局 lane1,024 条 × 200G
落在本机架 rail TH6 上的比例约 1/16
每机架跨机架 lane约 960 条
每 pod 跨机架 lane约 15,360 条(约 3.07 Pb/s)
若全部用 800G(4×200G)光约 3,840 条链路、7,680 只模块,每颗约 3.75 只
若用 1.6T(8×200G)光约 1,920 条链路、3,840 只模块;但每颗芯片要拆成 4 组 × 2 条接到 4 颗 TH6,需要 1.6T→4×400G 分支
  • SemiAnalysis 提到跨机架为铜背板与光配线(patch panel)混合,实际光 / 铜比例未披露。
  • rail TH6 若集中放在网络机架,而不是分散在 16 个机架里,以上链路数量基本不变。

9.6 置信度

内容级别
128 / 2,048、8 rail、TH6、“半扁平”两级 Clos、600 / 200 GB/s【官方】
16 托盘 × 8、6 个本地交换托盘 + 2 个全局交换托盘【本地】+【机构】
槽位对应 rail、4 组 × 2 条接法、32 颗全局 TH6、芯片中转路由、光模块数量【推算】,待 OpenAI 后续披露或 Hot Chips 原始讲稿核实

参考来源

本地(ECOC 2026,DAY1 9-20):

  • A1-Su3-Su4/0920-pm-Su3-A-02-OpenAI-ScaleUp互连需求.pdf:p6 芯片、p7 系统、p8 性能曲线;
  • PV-R-Su3-Su4/0920-pm-Su4-I-02-OpenAI-ScaleUp需求.pdf:p5–p6;
  • A2-Su1-Su2/0920-am-Su1-B-02-OpenAI-ScaleUp还能用铜吗.pdf:p6–p7,铜背板、16×8、TH6。

网络: