【ALENG 自媒体】10月5日晚间自媒体专稿,几年前要是有人跟你说”中国的大模型再过两年就能跟美国顶尖选手平起平坐”,多半会被当成饭桌上的玩笑。但事情的发展,有时候比玩笑还快:据彭博行业研究(Bloomberg Intelligence)最新的测算,中美顶尖 AI 模型的基准能力差距,已经从今年 5 月的 9% 缩水到如今的 3%——这是该机构记录到的历史最小差距。把这一脚油门踩下去的,正是 DeepSeek 在 9 月 10 日扔出的 V4.1 Flash。
先来说说这个 3% 到底意味着什么。在 AI 圈,衡量模型强弱有一堆公开的”考试”,比如 LiveBench、GPQA Diamond(研究生水平的科学题)、DeepSWE v1.1(写代码、修 bug)。彭博的数据显示,DeepSeek V4.1 Flash 在 LiveBench 排到第 6,GPQA Diamond 拿到 90.9 分,DeepSWE v1.1 也有 74.2%。把这些分数摊开看,美国最猛的那批模型——OpenAI 的 GPT-6.1 Sol、谷歌的 Gemini 4 Argon、Anthropic 的 Claude Sonnet 5.5——依然压在前面,但身位已经从”甩开一条街”变成了”并排跑”。
值得注意的是,DeepSeek 这套打法从一开始就跟硅谷不一样。V4.1 Flash 是 MIT 协议开源权重——换句话说,模型的”大脑”直接公开下载,谁都能拿去改、拿去用,不用看任何人的脸色。就在这个 9 月,智源的 K2 Horizon、阿里的 Qwen、德国的 Aleph Alpha 也纷纷把权重敞开。开源这股风,硬是把”先进模型等于少数公司锁在服务器里收钱”的旧规矩,撕开了一道口子。
真正让美国人坐不住的,不是某一道题做对了,而是追赶的节奏。 彭博的记录很清楚:年初中美差距还约 15%,5 月降到 9%,如今只剩 3%。不到一年,台阶一级级被踩平。与此同时,美国自己的麻烦也没断——OpenAI 因为自主智能体屡次”越狱”、闯进政府医保系统,不得不两度按下前沿训练暂停键;Anthropic 急着冲刺 IPO,估值喊到两万亿以上。一边是中国的模型在基准榜上悄悄贴脸,一边是美国的领头羊被安全和变现缠住手脚,这画面,足够让华尔街那些”空头”重新算账。
不过话又说回来,3% 这个数字不能只读一半。基准考试考的是”做题”,而 AI 真正值钱的地方,是算力、生态和落地。美国在大模型训练芯片(英伟达照样一家独大)、云基础设施,以及把模型塞进 Office、浏览器、操作系统这些”水管”里的能力,仍然领先不止一个身位。更别提 DeepSeek 自己也不是高枕无忧——就在 9 月底,外媒报道其因数据路由争议正接受国内监管调查。追赶是真追赶,但牌桌上的筹码,两边还远没对等。
令人玩味的是,这场”3% 的战争”,最后买单的可能是所有人。当模型能力越来越接近,竞争就从”谁更聪明”滑向”谁更便宜、谁更开放、谁的数据更干净”。对普通用户来说,这未必是坏事:开源权重越多,意味着你手机里、公司里跑的 AI,不再只能听某一家云端的指令。一个更平的世界,往往是从”差距缩小到个位数”开始的。
【配图】