哑了:9 月 3 日,半个世界打不开 ChatGPT

Global AI outage scene: data center with red emergency lights, monitors showing error messages, 16:9 cinematic.

哑了:9 月 3 日,半个世界打不开 ChatGPT

老实说,我也是那个早上才意识到,我已经离不开 AI 了。

北京时间 9 月 4 日凌晨,北美时间 9 月 3 日上午,三家全球最主流的 AI 大模型——ChatGPT、Claude、Grok——在 92 分钟之内先后倒下。整场风波持续 3 小时 40 分钟

Downdetector 上,OpenAI 收到 1.2 万多份故障报告,Claude、Grok 各自超过一千。AI 编程工具 Cursor 直接挂公告:Claude、ChatGPT、Grok 都躺了,它也跟着瘫了。

这不是某一家”小感冒”。这是 3 家头部 AI 集体失声。工程师工位上的”Ctrl+C/V”复活节,提前来了。

那一夜,到底发生了什么

最先倒下的是 Anthropic 的 Claude。

美东时间 9 月 3 日 9:23,Claude 多个模型——Opus 5、Opus 4.8、Mythos 5.1、Fable 5.1——错误率突然飙升。网页端、API、Claude Code,全部沦陷。

仅仅 7 分钟之后,xAI 的 Grok 全线下线。Web、iOS、Android、API,一片空白。

再过 1 小时 28 分,轮到 OpenAI。ChatGPT 和 Codex 错误率开始抬升,峰值时段,OpenAI 收到 3.7 万多份故障报告。

三家公司,首次报障的时间,误差不超过 5 分钟。

OpenAI 发言人 Kathleen Chaykowski 后续承认,故障是”路由错误”导致——大致可以理解为,BGP 协议或者内部负载均衡系统,没法把用户流量导到正确的服务器上。即使底层模型本身还活着,用户设备和服务器之间也连不上。xAI 那边更具体:Grok 挂在了孟菲斯超算的一次区域电力故障上——xAI 一直把自家算力吹得天花乱坠,这次也照样翻车。

同一时间窗口里,谷歌 Gemini、微软 Copilot 也出现大面积异常。Cursor 这种”模型聚合器”型的产品,损失最直接——它的”智能补全”功能,直接退化成”人工敲字”。

一直到美东时间中午 11:16,Claude 主要服务才率先恢复;ChatGPT、Grok 紧随其后;但 Anthropic 的 Opus 4.8 和 Opus 5 这两个高端模型,一直拖到下午才彻底回到基线。Grok 的安卓端,更是上午 10 点之后才陆续重启。

整场风波,持续了 3 小时 40 分钟。

为什么是三家一起挂

三家都把锅甩给了”基础设施”。

OpenAI 说,是路由错误。Anthropic 一位工程师在社交媒体上,只说”基础设施问题”。xAI 则很实在——SpaceX 旗下的 Grok,挂在了自家孟菲斯超算集群的一次电力故障上。

但市场更愿意相信一个更直白的版本:三家头部 AI,都深度绑在 微软 AzureCloudflare 这两条底座上。Azure 抖一抖,OpenAI、Anthropic、xAI 三家一起抖;Cloudflare 慢半拍,三家的 CDN、API 网关、鉴权中间件一起慢半拍。

Cloudflare 当天确实承认:HTTP/3 自定义域名那一段,出现性能下降或失败;部分 WARP 用户的地理位置识别,也跟着错位。Azure 那边的”US-East-2 区域连接抖动”告警,跟三家公司首次报障的时间窗口几乎重合。

这不是 2026 年第一次。2024 年 11 月,Cloudflare 一次配置误操作,就让 ChatGPT 和 Grok 同步断联。

说白了,过去三年 AI 行业狂奔在”更大参数、更快推理、更多 API”这条单行道上,把”韧性基建”当成了成本项,而不是战略资产。

单云依赖 = 单点失效。这么浅显的道理,在这一天被按在地上反复摩擦。

AI 不再是工具,是”数字社会操作系统”

宕机归宕机,市场反应更值得玩味。

风波当天,Palantir 股价单日暴涨 7.71%,市值一夜涨了 42 亿美元。市场用最直白的方式投票——当大模型集体罢工,能跑通”本地化、可审计、可兜底”的 AI 基础设施,才是 2026 年最硬的数字黄金。

有意思的是,这场波及面远比”3 家大厂挂”要广。Anthropic 的 Claude 早就接入了一票企业级客户——从客服到内容生成,从代码辅助到法律检索。这次”集体失语”,意味着这些企业的工作流,也跟着一起断了 3 个多小时。Cursor 这种依赖 Claude、ChatGPT、Grok 做混合调用的工具,更是在宕机期间彻底”无脑可用”。

同一时间,OpenAI 在宕机风暴眼里,悄悄甩出了 GPT-6 Astra,宣称已经触及”AGI 时代”的门槛,还自夸是首个达到内部”关键网络安全能力门槛”的模型——所谓”关键”,就是能在无人工干预下自主发现并利用未知漏洞。

这事怎么想都有点黑色幽默:三家公司刚用 3 小时 40 分证明自己连供电都稳不住,OpenAI 就跳出来说”我们已经准备好让 AI 自己去找漏洞了”。

更耐人寻味的是 RSI——自我递归强化训练。OpenAI 9 月 1 日刚官宣 Astra 达到这个能力,被硅谷热议;9 月 3 日,整个 AI 圈静默 3 小时 40 分。一个连自身供电都存在单点失效的产业,真敢把”自我进化”的钥匙,交给尚未通过压力测试的超级智能吗?

这已经不是技术故障,这是一记响亮的伦理警钟。

我的一点看法

说到底,这一夜把行业最怕的三个字写在了脸上:单点依赖

三家公司表面上是竞争对手,底层却把命根子都拴在了 Azure 和 Cloudflare 这两棵树上。任何一次区域故障、任何一次配置误操作,都能让全球数百万用户”集体失语”。

这事对开发者的启示其实更直接:别再把命运押给单一云厂商。多云架构、本地推理、可插拔模型调度,这些过去被当成”成本项”的工程债,会从今天起变成”战略资产”。

而对马斯克来说,这一夜多少有点尴尬。他旗下的 Grok 也挂了,挂在自家 SpaceX 的孟菲斯机房里。X 平台和 xAI 一直标榜”自建超算、自有电力”,结果这次同样没能躲过共享云基建那把刀。

马斯克这次,显然也没能跳过这道坎。

写在最后

上一次类似的全球级宕机,还要追溯到 2021 年 Facebook 断网 7 小时——那次推动了 DNS 根服务器去中心化的讨论。

这一次,3 小时 40 分的”黑色星期四”,会不会真正终结”大模型即一切”的幻觉?

未来 12 个月,值得盯着一道题:头部 AI 厂商的算力布局,会从”集中式超算”被迫转向”分布式多云”——还是另一句话,继续赌 Azure 不会出问题。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注