版本 v1 · 2026-10-01

配套文件:

口径说明

  • 全球部分: 以 Epoch AI 公开数据集(2026-10-01)为主。功率统一用 IT 功率,园区总电力约为其 1.2–1.4 倍。

  • 中国部分: Epoch 只收录了 4 个中国园区(阿里张北、华为和林格尔、华为芜湖、世纪互联乌兰察布巴音),其余来自公司公告、地方政府和媒体报道。中国厂商很少按 MW 披露,多用”机柜数、服务器台数、卡数、EFLOPS”,这几种口径不能直接换算或相加。

  • 规模换算参考:

    • 1 GW AI 园区在 NVIDIA 口径下约 30 万颗 Rubin GPU;
    • 中国 1 万张国产卡集群约 6–7 EFLOPS(FP16,中国移动哈尔滨、呼和浩特的数据);
    • 国内 12 kW 机柜按约 15 MW/千柜估算。

    这些只用于判断量级。

  • “训练/推理”的划分: 来自公司表述或负载推断,同一园区往往同时承担两类负载。


〇、结论

  1. 全球头部的建设单位已是”GW 级园区”,中国的单位还是”万卡集群、百 MW 园区”,但正在跨向 GW。

    • 北美: Microsoft Fairwater Wisconsin、Stargate New Mexico、Meta Hyperion、Amazon New Carlisle、xAI Colossus 2 都在 2026–2028 年达到 1–2 GW IT 功率。
    • 中国: 已知最大单园区约 0.2–0.4 GW,比如世纪互联乌兰察布巴音 221→700 MW、华为芜湖 157→457 MW、东南亚的 DayOne 柔佛 Kempas 422 MW。2026 年 9 月有媒体报道字节在乌兰察布谈 5–6 GW,若成真,将是中国第一个 GW 级以上的单一项目群。
  2. 资本开支差距约 8–10 倍,规模差距更小。 北美五家 2026 年约 7000–8000 亿美元,中国四家约 5000–6000 亿元(约 700–850 亿美元)。中国芯片和建设成本低,按算力看差距小于投资额差距。全国智算规模 2026 年 6 月约 2185 EFLOPS(FP16,官方口径)。

  3. 训练的地理:

    • 北美: 集中到少数 GW 级园区或园区组团,选址看电力和建设速度。
    • 中国: 前沿训练的位置被出口管制改写。字节、腾讯一部分训练在东南亚(马来西亚柔佛、印尼巴淡岛),国产芯片训练集中在内蒙古(乌兰察布、和林格尔、呼和浩特)、河北张家口、东北哈尔滨。
  4. 推理的地理:

    • 北美: 沿用全球几十个云区域,并向主权云和海外延伸(xAI 沙特、Stargate UAE、Microsoft 33 国主权云)。
    • 中国: 推理在东部枢纽和西部枢纽之间分配,靠 20 ms(国家)或 10 ms(华为云)时延圈,西部园区也能服务大部分交互推理。
  5. 三种所有权模式并存。

    • 自建自有: Google、Meta 大部分园区、阿里、腾讯、百度、华为、运营商。
    • 开发商代建、长期租用: OpenAI、Anthropic 部分园区、Microsoft 的 neocloud,以及字节依托秦淮、润泽、世纪互联。
    • 合资融资: Meta Hyperion(Blue Owl 持股 80%)、Meta El Paso(BlackRock)、Stargate。

    中国第三方 IDC 承担了字节、快手等互联网公司的大部分训练机房。

  6. “园区群”是中美共同的现象。

    • 北美: 俄亥俄 New Albany(Google、Meta、AWS 三家同区)、德州 Abilene、威斯康星东南、El Paso–Santa Teresa。
    • 中国: 乌兰察布(2026 年 6 月签约 89 个项目、计划投资超 5000 亿元,阿里、华为、快手、字节、世纪互联、秦淮、苹果都在)、和林格尔、张家口、芜湖。

    园区群内部 20–80 km 的大容量互联和”西部园区群到东部枢纽”的长距大容量传输,是中美光网络需求最集中的两类场景。


一、全景对照表

厂商2026 资本开支当前 AI 园区规模规划规模主要训练布局主要推理布局所有权
Microsoft约 1900 亿美元(财年口径)自有 AI 园区约 1.5 GW ITFairwater Wisconsin 2028 年 2.26 GW;两年规模约翻倍Fairwater Atlanta + Wisconsin,AI WAN 互联全球约 70 个区域、33 国主权云自建 + neocloud 租用(>600 亿美元)
Google1950–2050 亿美元约 3.2 GW IT(20 个园区)约 5.9 GW(2028)+ 印度 2.51 GW + 德州新园区Iowa/Nebraska、Ohio 组团;TPU + OCS + DiLoCo全球区域;TPU 8i 推理芯片(2027)自建自有
Amazon / AWS约 2200 亿美元过去 12 个月新增 3.8 GW;AI 园区约 1.7 GW IT(Epoch)2027 年总电力容量再翻倍;Indiana 2028 年 1.9 GWRainier(Indiana)、Mississippi 两园区,Trainium2 给 AnthropicBedrock 全球区域,多数 token 在 Trainium自建自有
Meta1300–1450 亿美元约 2.2 GW IT(17 个园区)约 5.3 GW(2028)+ Hyperion 最终 5 GW + El Paso、Lebanon 各 1 GW;“本十年数十 GW”Prometheus、Hyperion(单园区多楼)30 多个既有园区,MTIA自建为主,大项目合资
Oracle约 500 亿美元最近一季交付 850 MW、30 万 GPU未来三年锁定 >10 GW 电力,90% 以上由合作方出资Stargate Abilene 等(为 OpenAI)OCI 区域;巴淡岛为腾讯提供 Blackwell合作方出资代建
OpenAI2030 年前约 6000 亿美元(已下调)使用中约 2.5 GW IT(全部租用)Stargate 美国 7 站约 7 GW IT(2027–2028)、UAE 1 GW、印度 0.1–1 GWStargate Abilene、Fairwater多云 + Cerebras 750 MW + Jalapeño全部租用
Anthropic自建 500 亿美元(Fluidstack)2026 年底约 5 GW(NYT)2027 年再翻倍;管线 >15 GW(Measured AI 估算)AWS Rainier(Trn2)、Google TPU(最多 100 万颗)、自建 Lake Mariner(TPU v7)Bedrock、Vertex、Azure 多平台租用为主,开始自建
xAI(SpaceXAI)—Colossus 1+2 约 1.3 GW ITColossus 2 2027 年 1.53 GW;MACROHARDRR 约 250 MW;沙特 500 MWMemphis/Southaven 单站点沙特 Humain 500 MW;Colossus 1 出租给 Anthropic自建
阿里巴巴年化 1500–2000 亿元;Q2 676.8 亿元张北 169 MW(Epoch,H20);五大超级数据中心2032 年全球 >20 GW;海外 31 区域 107 可用区,未来一年再加 8 国乌兰察布、张北灵骏(真武 M890)东部区域与海外区域;北方地域承接非交互推理自建自有
字节跳动1600–2000 亿元(媒体)柔佛 DayOne 两园区约 660 MW(Epoch 未标用户,市场普遍认为是字节);乌兰察布巴音 221 MW(华为昇腾,用户推测为字节)乌兰察布 5–6 GW(早期谈判,2028 H1)海外(马来西亚 B200)+ 秦淮乌兰察布/张家口(媒体称 10 万卡)芜湖、大同、和林格尔、乌兰察布;豆包日均 180 万亿 token第三方 IDC 为主 + 自建
腾讯Q2 527.8 亿元(+176%)清远、怀来、仪征、重庆、天津、贵安等百万级服务器园区;Oracle 巴淡岛 72 MW(Blackwell)海外:沙特、印尼(5 亿美元)自用为主,国产训练卡(燧原)+ 海外 Blackwell元宝、微信 AI,推理卡寒武纪、昆仑芯自建 + 海外租用
百度Q2 114 亿元昆仑芯 P800 3 万卡集群(2025);全国最大国产 AI 算力池超 3 万卡(2026-02)昆仑芯 A+H 上市推进阳泉、保定(徐水、定兴)百度智能云;盐城智算中心自建
华为云—和林格尔 184 MW、芜湖 157 MW(Epoch,昇腾 910C)和林格尔 346 MW(2028)、芜湖 457 MW(2027);贵安规划 100 万台服务器;Atlas 950 SuperCluster 50 万–100 万卡Atlas 950 SuperPoD(2026Q4)CloudMatrix384 四大枢纽,10 ms 时延圈自建
中国移动—智算 92.5 EFLOPS(2025 年底)—哈尔滨(1.8 万卡)、呼和浩特(约 2 万卡)省级与边缘智算自建
中国电信—智算 118.8 EFLOPS(自建 + 接入);16 个百兆瓦级园区—京津冀、上海临港万卡;与阿里共建大湾区真武万卡省级与边缘智算自建
中国联通—7 个百兆瓦级园区临港、呼和浩特、中卫、三江源超大规模智算庆阳区域、本地三级自建
快手—乌兰察布星河:约 2 万个 10 kW 机柜,30 万台服务器—乌兰察布东部自建
商汤—商汤总算力 4.04 万 PFLOPS;临港 AIDC与香港科技园建 4 万 P 国产算力临港—自建

二、全球头部厂商

Microsoft、Google、Meta、OpenAI 的逐园区地址和时间线见配套报告,这里只补充训练和推理布局的要点,并展开 Amazon、Anthropic、xAI、Oracle。

2.1 Microsoft

  • 训练: Fairwater Atlanta(Fayetteville,GA,636 MW)和 Fairwater Wisconsin(Mount Pleasant,WI,369→2,263 MW,2028)经 AI WAN 互联,单作业可跨两个区域;Milwaukee 一带还有多个 Fairwater 在建。
  • 推理: 全球约 70 个区域;同一批硬件跑训练和推理,即”可互换算力池”。
  • 补缺: 向 Nscale(约 230 亿美元)、IREN(97 亿美元,德州 Childress 750 MW)、Nebius(新泽西 Vineland、芬兰 Mäntsälä)、Lambda 租用;接手原 Stargate Norway(Narvik)和 Abilene 扩建(Crusoe 代建,2027 年 672 MW)。

2.2 Google

  • 训练: Ohio(New Albany、Columbus、Lancaster)和 Iowa/Nebraska(Council Bluffs、Omaha、Papillion、Lincoln)组团。新的 GW 级单园区有德州 Goodnight(Claude,TX,2027 年 1.0 GW,Crusoe 代建)和 Fort Wayne(IN,2028 年 0.86 GW)。
  • 推理: 全球区域。Ironwood 定位为”推理时代的 TPU”,TPU 8 拆成训练用 8t 和推理用 8i;每月处理约 3.2 千万亿 token。
  • 海外: 印度 Visakhapatnam(150 亿美元,环评批复 2.51 GW)、英国 Waltham Cross。

2.3 Amazon / AWS

园区地址当前 IT 功率规划 IT 功率(时间)芯片用途
New Carlisle(Project Rainier)55001 Larrison Blvd, New Carlisle, IN 46552910 MW1,925 MW(2028-03)Trainium2Anthropic 训练
Ridgeland1626 County Line Rd, Ridgeland, MS228 MW840 MW(2028-09)Trainium2Anthropic
Madison Mega SiteNissan Parkway 一带, Canton, Madison County, MS284 MW683 MW(2028-03)Trainium2Anthropic
AWS New Albany13360 Miller Rd NW, New Albany, OH213 MW338 MW(2027-07)Trainium2、H100/H200/B200混合
Berwick1125 Electron Ave, Berwick, PA 18603108 MW169 MW(2027-08)Trainium2Anthropic;紧邻 Susquehanna 核电站
  • 规划: 过去 12 个月新增 3.8 GW,2027 年总电力容量再翻倍;宾夕法尼亚 Salem、Falls 两个镇的 AI 园区投资 200 亿美元;预计 2027 年底在密西西比州达到 1.5 GW。
  • 训练与推理: 训练集中在 Indiana 和 Mississippi 的 Trainium2 园区,主要给 Anthropic;推理在 Bedrock 全球区域,多数 token 已在 Trainium 上,Trn3 每兆瓦输出 token 比 Trn2 高 5 倍以上。
  • 背后原因: 自研芯片 + 自有园区 + 大客户长约(AWS 积压订单接近 2000 亿美元),用确定的需求支撑 GW 级建设。

2.4 Anthropic

  • 规模: NYT 报道 2026 年底约 5 GW,2027 年再翻倍;Measured AI 估算美国管线超过 15 GW。
  • 训练:
    • AWS Rainier(Trainium2);
    • Google TPU,最多 100 万颗,另有 Google/Broadcom 新一代 TPU 多 GW 合同,2027 年起上线;
    • 自建园区:与 Fluidstack 合作,投资 500 亿美元,首批在德州和纽约州。Epoch 记录的 Lake Mariner(7725 Lake Rd, Barker, NY)用 TPU v7,42→378 MW(2027-03);Barber Lake(Cipher Mining)2027 年 207 MW。
  • 租用 xAI: Epoch 记录 Anthropic 是 Colossus 1 的用户,并自 2026 年 6 月起使用 Colossus 2。
  • 推理: Bedrock、Vertex AI、Azure 多平台分发。
  • 背后原因: 三种芯片、多家云,首先是保供给;自建园区是为了在长期成本和可控性上减少对单一云的依赖。

2.5 xAI(SpaceXAI)

园区地址当前 IT 功率规划 IT 功率芯片 / 用户
Colossus 25420 Tulane Rd, Memphis, TN 38109(发电在密西西比州 Southaven)946 MW1,531 MW(2027-02)B200、B300;用户含 SpaceXAI、Anthropic、Cursor
Colossus 13231 Riverport Rd, Memphis, TN 38109340 MW340 MWH100/H200/B200;用户 Anthropic
MACROHARDRR(Colossus 3)Southaven, MS(紧邻 Colossus 2)约 250 MW(媒体)—约 20 万 GPU
沙特 Humain 合作沙特0500 MWGrok 推理
  • 背后原因: 训练追求单站点最大规模和最快建设,用燃气轮机先行供电(曾因无许可运行被起诉);推理借主权基金的资金和电力出海;旧集群出租给 Anthropic 变现。

2.6 Oracle

  • 规模: 最近一季(FY27 Q1)交付 850 MW、30 万颗以上 GPU;未来三年锁定超过 10 GW 电力和数据中心容量,90% 以上由合作方出资。
  • 角色: Stargate 的主要运营方,涉及 Abilene、Shackelford、New Mexico、Michigan、Wisconsin。
  • 对外: 在印尼巴淡岛为腾讯提供 72 MW 的 Blackwell 算力(Epoch 记录)。
  • 背后原因: Oracle 用合作方资金和长期合同(积压订单约 5530 亿美元)扩张,本质上是”为别人的训练建园区”。

2.7 主权与区域项目

区域项目规模训练 / 推理
沙特Humain10 年约 6.6 GW;首批利雅得、达曼各 100 MW;另有 11 个数据中心 2.2 GW 的计划以本国推理和对外出租为主;xAI 500 MW 部署 Grok
阿联酋G42 5 GW 园区;Stargate UAEStargate 1 GW,首期 200 MW 预计 2026 年底OpenAI、Oracle 运营,区域推理和训练
马来西亚柔佛DayOne Kempas、Nusajaya约 422 MW + 240 MW(2026),Nusajaya 规划 473 MW市场普遍认为主要服务字节,承担 Blackwell 训练
印尼巴淡岛Oracle Batam72 MW,Blackwell腾讯使用
印度Google Visakhapatnam;Reliance Jamnagar;OpenAI × Tata2.51 GW(环评);2026 年 120 MW 以上,Meta 租用 168 MW;100 MW→1 GW本地推理和数据驻留为主
欧洲法国–阿联酋 1 GW 园区;Mistral(Essonne 40 MW、瑞典 Borlänge 2028 年 48 MW);Nscale(Narvik、Sines、Keflavik)百 MW 级为主主权模型训练 + 本地推理
日本SoftBank AI 数据中心 GPU 云(2026-10 商用)—本地推理和训练

主权项目的共同点:规模在百 MW 到数 GW,资金来自主权基金或国家,选址看能源和数据驻留,首批负载以本国推理为主。


三、中国头部厂商

3.1 总体格局

  • 全国智算规模: 2026 年 6 月约 2185 EFLOPS(FP16)。
  • 政策骨架: 东数西算八大枢纽、十大集群,枢纽之间 20 ms 时延圈。
  • 乌兰察布成为最大的集中地: 2026 年 6 月签约 89 个算力项目、计划投资超过 5000 亿元,入驻者包括阿里、华为、快手、字节(经由秦淮、世纪互联)和苹果。有媒体称当地规划总量约 12.5 GW(未见官方确认)。
  • 资本开支: 腾讯与阿里 2026 年第二季度合计超过 1200 亿元,同比分别 +176% 和 +75%;百度单季约 114 亿元,同比约 +200%。
  • 芯片: 国产替代加速。华为昇腾、昆仑芯、寒武纪、燧原分别进入华为云、百度、腾讯、运营商的集群;Epoch 记录的中国园区芯片已是昇腾 910C 和 H20。

3.2 阿里巴巴 / 阿里云

  • 规划: 2032 年全球数据中心能耗是 2022 年的 10 倍,超过 20 GW;资本开支从”三年 3800 亿元”改为年化 1500–2000 亿元。
  • 国内园区: 张北、河源、杭州、南通、乌兰察布五大超级数据中心,加上中卫等。Epoch 记录张北园区 169 MW,芯片 H20。
  • 海外: 31 个区域、107 个可用区。2026 年 6 月巴黎、柔佛开服;未来一年在土耳其、芬兰、荷兰首次开区域,并扩建马来西亚、德国、阿联酋、法国、香港。
  • 训练:
    • 乌兰察布、张北的灵骏集群;
    • 真武 M890 超节点 2026 年 8 月首发乌兰察布;
    • 与中国电信在大湾区共建”真武”万卡集群(2026-04)。
  • 推理:
    • 杭州、上海、北京、深圳等东部区域和海外区域就近服务;
    • 乌兰察布、张家口地域也提供推理部署资源,承接对时延不敏感的推理;
    • MaaS 份额最高(研究机构口径约 35.8%)。
  • 背后原因:
    • 电价:乌兰察布约 0.3 元/kWh,每年省电费约 50 亿元;
    • 东数西算;
    • 海外区域首先服务出海客户的数据驻留,也是获取海外芯片的渠道之一。

3.3 字节跳动 / 火山引擎

  • 规划: 2026 年资本开支 1600–2000 亿元(媒体)。2026 年 9 月媒体报道字节在乌兰察布集宁区谈 5–6 GW 的 AI 集群,2028 年上半年交付,按每 GW 约 1600 亿元推算投资 8000–9600 亿元。目前是早期谈判,尚无官方确认。

  • 国内园区:

    园区投资与规模
    芜湖长三角算力中心80 亿元,21,824 个机柜
    大同太行二期45 亿元,15,604 个 12 kW 机柜
    和林格尔两期约 120 亿元
    乌兰察布经由第三方
  • 第三方 IDC: 秦淮数据的乌兰察布和张家口基地(媒体称承载豆包超 10 万卡训练集群,新建项目全液冷适配 Rubin);世纪互联乌兰察布巴音,Epoch 记录 221→700 MW(2027-09),芯片昇腾 910C,用户推测为字节;润泽科技。

  • 海外: 马来西亚柔佛,DayOne Kempas 422 MW、Nusajaya 240→473 MW(Epoch);另经 Aolani 使用约 3.6 万颗 B200(媒体);东南亚 5 国均有数据中心。

  • 训练: 前沿训练相当部分在海外(Blackwell),国内训练依托秦淮、世纪互联的西部和北方园区,并开始使用昇腾。

  • 推理: 豆包日均超过 180 万亿 token(自报),国内园区首先满足推理;火山引擎 MaaS 份额最高(自报 49.5%)。

  • 背后原因:

    • 出口管制,所以境外训练、境内推理;
    • 推理量全国最大,需要国内大量机柜;
    • 依赖第三方 IDC 的原因是建设速度和资金,2026 年 2 月有专门分析讨论”火山引擎为什么还大规模依赖秦淮和润泽”。

3.4 腾讯

  • 规划: 2026 年第二季度资本开支 527.8 亿元,同比 +176%,拆成”现有业务”和”AI 原生业务”两块;业绩会表示不准备出租算力。
  • 国内园区: 华南清远、京津冀怀来和天津、长三角仪征、成渝重庆、贵安七星(隧道机房)。这些是传统的百万级服务器园区集群,单园区规划 20–30 万台服务器。
  • 海外: 沙特(双可用区,投入超过 1.5 亿美元);印尼第三个数据中心(5 亿美元);在 Oracle 印尼巴淡岛使用 72 MW Blackwell(Epoch)。
  • 训练: 国内转向国产训练卡(燧原,媒体口径),海外使用 Blackwell。
  • 推理: 元宝、微信 AI、CodeBuddy、WorkBuddy,推理卡用寒武纪和昆仑芯(媒体口径)。
  • 背后原因: 产品驱动,推理优先保障自家业务;海外 Blackwell 补训练缺口。

3.5 百度

  • 园区: 山西阳泉、河北保定(徐水、定兴)、江苏盐城智算中心(昆仑芯)。
  • 规模: 2025 年点亮昆仑芯 P800 万卡集群,随后扩到约 3.2 万卡;2026 年 2 月称建成”全国最大国产 AI 算力池”,超过 3 万卡。
  • 训练与推理: 在全国产集群上训练文心 5.1(自报);推理走百度智能云,昆仑芯对外销售,腾讯是客户。
  • 背后原因: 自研芯片同时解决训练供给和推理成本,昆仑芯 A+H 上市分摊研发。

3.6 华为云

  • 园区:

    园区规模
    贵安一期 9 栋机房,整体规划 100 万台服务器,华为全球最大的云数据中心
    乌兰察布约 2000 机柜(早期口径)
    和林格尔Epoch 记录 184→346 MW(2028-02),昇腾 910C
    芜湖Epoch 记录 157→457 MW(2027-12),昇腾 910C
  • 训练: Atlas 950 SuperPoD(8192 卡,2026Q4);SuperCluster 50 万–100 万卡。

  • 推理: CloudMatrix384 在乌兰察布、和林格尔、贵安、芜湖四大节点上线,宣称 10 ms 时延圈覆盖 19 个城市群。

  • 背后原因: 用大超节点弥补单卡性能,正好适配 MoE 推理的大 EP;节点选在西部和中部枢纽,依靠时延圈服务东部用户。

3.7 三大运营商

运营商智算规模主要训练集群推理布局
中国移动92.5 EFLOPS(2025 年底);智算收入同比增长 279%哈尔滨(1.8 万卡、6.9 EFLOPS、100% 国产)、呼和浩特(约 2 万卡、6.7 EFLOPS)省级与边缘;GSE-DCI 跨 100 km 以上训练
中国电信118.8 EFLOPS(自建 + 接入);16 个百兆瓦级园区京津冀、上海临港等 4 个国家级万卡集群;与阿里共建大湾区真武万卡省级与边缘;409.61 km 多芯光纤分布式训练验证
中国联通7 个百兆瓦级园区庆阳;规划上海临港、呼和浩特、中卫、三江源超大规模、区域、本地三级
  • 背后原因: 运营商资源天然分散在各省,跨域训练是盘活资源的手段;推理依托现有骨干网和城域网下沉。2026 年三家都在从”卖流量”转向”卖 token”。

3.8 其他

  • 快手: 乌兰察布星河数据中心,约 2 万个 10 kW 机柜、30 万台服务器,投资约 100 亿元。

  • 商汤: 上海临港 AIDC,商汤总算力 4.04 万 PFLOPS;2026 年 6 月与香港科技园合建 4 万 P 国产算力。

  • 京东云: 推 AIDC 智算产品组合,单柜 20–100 kW,以对外交付为主。

  • 第三方 IDC:

    • 秦淮数据:乌兰察布、张家口,主要服务字节;
    • 润泽科技:廊坊、平湖、惠州;
    • 世纪互联:乌兰察布巴音;
    • 万国数据:长三角、京津冀、海外 DayOne。

    它们是中国互联网公司训练机房的主要供给者,角色和北美的 Vantage、QTS、Crusoe 相当。


四、训练与推理布局:全球与中国对照

维度全球头部(以北美为主)中国头部
训练选址电力规模和建设速度;德州、俄亥俄、内布拉斯加/艾奥瓦、威斯康星、路易斯安那、印第安纳、密西西比电价 + 东数西算 + 出口管制;内蒙古(乌兰察布、和林格尔、呼和浩特)、张家口、哈尔滨、贵安、芜湖,另加东南亚(柔佛、巴淡岛)
训练单元GW 级单园区或园区组团;10 万–百万 GPU万卡到 3 万卡集群为主,超节点 384–8192 卡;开始规划 GW 级(字节乌兰察布)
训练芯片NVIDIA Blackwell/Rubin、TPU v7、Trainium2/3境内:昇腾 910C/950、昆仑芯 P800、燧原、H20;境外:Blackwell
推理选址全球几十个云区域、主权云、海外合作园区东部枢纽为主,西部和中部枢纽借时延圈承接;海外区域服务出海
推理芯片专用化:TPU 8i、MTIA、Trainium、Jalapeño、Cerebras、Groq LPX国产先行:寒武纪、昆仑芯、昇腾 CloudMatrix384
所有权自建(Google、Meta、AWS)、租用(OpenAI、Anthropic、Microsoft 部分)、合资(Meta、Stargate)自建(阿里、腾讯、百度、华为、运营商)+ 第三方 IDC(字节、快手)
规模趋势每家 2030 年前 10 GW 级头部 2028–2032 年开始进入 GW 级(阿里 20 GW 远期、字节 5–6 GW 传闻)
主要约束电力并网、燃气轮机与变压器供应、地方反对芯片供给、单卡性能、西部到东部的网络时延

规律:

  1. 训练向电力富集地集中,推理向用户和数据驻留地分散。 这一点中美一致,但中国的”电力富集地”和”用户所在地”在地理上分得更开(内蒙古对东部沿海),所以对长距大容量传输的依赖更强。
  2. 出口管制让中国厂商多了一个”境外训练”维度。 字节和腾讯在东南亚的 Blackwell 园区(柔佛约 0.66 GW、巴淡岛 72 MW)规模已经和国内单个大园区相当。
  3. 推理芯片的分化在中美同时发生,原因不同。
    • 北美: 降低单位 token 成本,为此为推理单独做芯片。
    • 中国: 国产芯片先在推理上替代,因为推理对生态和规模的要求低于训练。
  4. 园区群化。 两边都出现多家公司扎堆的园区群(New Albany、Abilene 对乌兰察布、和林格尔),群内互联和群到用户区的长距传输是光网络的主要增量。

五、对光互连的含义

  • 园区群内 20–80 km: 北美 Abilene、New Albany、威斯康星东南,中国乌兰察布–呼和浩特–和林格尔,都需要 Coherent-Lite、ZR/ZR+、多 rail 线路系统。乌兰察布到呼和浩特约 130 km,到北京约 300 km 以上,属于 ZR+ 和区域 OTN 的范围。
  • 西部园区群到东部用户区的长距大容量传输: 中国的需求更强。内蒙古到京津冀、长三角、大湾区是 300–2000 km,要求 C+L 或全频段、1.6T 级相干,以及空芯光纤降时延。中国电信给出的路线是 400G 已部署→800G 试验→1.6T 实验,频谱从 C+L 约 12 THz 到全频段超过 37 THz。
  • 超节点内光化: 中国更早。384–8192 卡的全光超节点(华为)和北美 NVL72 的铜互连相比,光模块需求早一代、量大一个数量级。
  • 跨境: 东南亚(柔佛、巴淡岛)与国内之间的训练和推理协同,带来海缆与跨境陆缆需求,但数据合规会限制这类协同的深度。

六、数据可靠性与待核实

  • 中国: 中国厂商的园区规模大多来自地方政府新闻和媒体,按机柜、服务器、卡数、EFLOPS 等不同口径披露,没有统一的 MW 数据,表中不能直接相加。
  • 字节: 乌兰察布 5–6 GW、秦淮”10 万卡训练集群”、柔佛 DayOne 的用户归属、腾讯和字节的芯片供应商,均为媒体或推测,Epoch 本身也标注为 speculative。
  • 北美远期: Anthropic 的 5 GW 和 15 GW、xAI 的 MACROHARDRR 规模来自媒体或研究机构估算。
  • 时间线: Epoch 的时间线基于卫星图像推算,会随新影像修正。

来源