半价追平:Grok 4.6 一夜跑赢 GPT-5.6 的真相

半价追平:Grok 4.6 一夜跑赢 GPT-5.6 的真相

8 月 12 日晚,北京时间 23 点 32 分,马斯克旗下的 SpaceXAI 悄悄把新一代大模型 Grok 4.6 推上了线。和以往那种”先吹半年再挤牙膏”的剧本不一样,这次几乎没有预热——可它一上来,就把 OpenAI 的旗舰 GPT-5.6 Sol 拉下了马。

Artificial Analysis 的 Intelligence Index 上,两家打成 61 平。GDPVal-AA v2 这种”干实事”的基准,Grok 4.6 拿了 1753 Elo,把对手按在身后。关键是,标价只有人家一半。

半价追平的真相

谁也没想到,去年还排到第 17 名的 Grok,能这么快追上来。

Intelligence Index 是个硬指标——它把数学、科学、编程、推理 9 项测试拉通算一个综合分。Grok 4.6 拿到 61 分,和 GPT-5.6 Sol Max 持平。Opus 5(63)和 Fable 5(62)还站在它头上,可差距只剩 1 到 2 分——这个量级,相当于你跟同事跑步时咬住了人家的衣角。

但更扎眼的是另一项测试:GDPVal-AA v2。它不考数学不考代码,专门拿”现实世界里的白领工作”来考 AI——覆盖 44 个职业、9 个行业,要模型在工具环境里干完活、产出文件,再让真人盲评两两打分。Grok 4.6 拿了 1753 Elo,Fable 5 是 1741,GPT-5.6 Sol 是 1728。它不只是追平,它把对手挤了下去。

这些分数背后,是一套”加量不加价”的策略。输入 token 2 美元、输出 6 美元——和上一代完全一样。Opus 5 是 5 美元/25 美元,GPT-5.6 Sol 是 5 美元/30 美元。换句话说,Grok 4.6 给你同样的智能,便宜 60% 到 80%。

按每任务成本算,每干一件事 0.84 美元,比 Kimi K3 还低一档。Gavin Baker 把它翻译成了一句投资人听得懂的话:性能与 Fable 5 持平,便宜约 85%。Artificial Analysis 给出的结论是——Grok 4.6 站在”智能 vs 每任务成本”的 Pareto 前沿上。

1.5 万亿参数怎么越级打的

这事其实有点反常识。

上一代 Grok 4.5 用的就是 1.5 万亿参数,这次 4.6 没换”骨架”。但成绩却往前蹿了一大截——Intelligence Index 涨了 5 分,AA-Briefcase 从 1313 涨到 1577,FrontierCode 从 56.6% 升到 61.3%。同样的体格,怎么就多干了这么多活?

官方说,4.6 经历了”比 4.5 更长的补充训练”。具体来说,是把模型自己生成的推理数据、高级技术概念数据、高质量工程数据全过了一遍,改进优化器和训练方案。然后用 4.5 在不同推理强度、不同智能体框架下重写监督学习轨迹——再让模型基于自身检查剔除问题样本。最后是更广泛的强化学习,覆盖知识工作、通用编程、内核优化、Web 开发、计算机辅助设计。

听起来都是些”老中医”式的修补——但别忘了,SpaceXAI 6 月刚以 600 亿美元全股票收购了 Cursor。这家 AI 编程工具公司在 4.5 训练时就已经把数万亿 token 的真实开发数据喂给 Grok,记录了开发者怎么改代码、怎么调工具、怎么和 AI 协作。Grok 学的不是”代码本身”,而是”软件是怎么被做出来的”。

这也解释了为什么 4.6 在 GDPVal 这种”干实事”测试上反超——它真的在练怎么干活。Databricks 的 Ivan Zhou 放出一张成本-质量图:Grok 4.6 站在最高正确率的位置,单次运行成本落在数美元这一档,把 Fable、Opus、Sol 都甩在右下角。NVIDIA 也跑出来贺电:Grok 4.6 是在 GB300 NVL72 上训练和运行的。

价格战打到智能体时代

这才是最让同行坐不住的地方。

GPT-5.6 Sol 每任务约 1.23 美元,Claude Opus 5 约 2.34 美元。换句话说,同样干一件事,Grok 4.6 的账单是 Sol 的 68%,是 Opus 5 的 36%。Arthur MacWaters 给了一个更干净的判断:”Grok 4.6 拥有最高的每美元智能。token 很贵,没人会花 10 美元买 140 智商——如果 0.10 美元就能买到 125。”

这不是简单的”降价抢市场”——它背后是一整个生态布局。8 月 11 日,SpaceXAI 先把”数字同事”Grok Bot放了出来,让 AI 直接登录用户的工具箱干活。8 月 12 日发布的 4.6 顺势成了这套产品的发动机。Cognition 第一时间把 Grok 4.6 接入 Devin,做软件工程任务的 AI 程序员。

而就在前一天的全员大会上,马斯克已经给 SpaceX 的 AI 业务画好了大饼:Q2 AI 收入 26 亿美元,环比 +213%、同比 +247%;到 9 月 AI 收入将超过 SpaceX 所有其他业务,第四季度大幅甩开;明年底 10 GW 算力上线,按每瓦 30 到 50 美元算,年收入 3000 亿到 5000 亿美元。

更狠的是下一句:四年五年后,AI 会占到 SpaceX 价值的 99%。他甚至让员工放心:未来想去月球或火星的,公司包了。

这不是一个航天公司在说梦话。这是个手里攥着 22 万张 H100/H200、3 万张 GB200、55 万张 GB200/GB300 的人,对未来算力版图的重押。

说两句

老实说,这种事我们 12 个月内都未必看得完。

Grok 4.6 不是神。它在 DeepSWE 1.1Terminal-Bench v3.0 上还是输给 GPT-5.6 Sol;终端任务、纯深度编码也不是它最擅长。Anthropic 也不可能坐以待毙——按 Gavin Baker 的说法,4.7 才会”大得多”,还得纳入 Cursor 和 SpaceX 自己的工程语料。马斯克在回复 Cognition 时也讲得很克制:”4.7 将超越当前所有模型。不过 Anthropic 是一家伟大的公司,可能很快会发布改进的模型。”

但有一件事已经定下来:智能相近的情况下,token 价格会变成竞争的真正主战场。一家小公司选模型,不会再只盯着那 1、2 分的智能指数差——它会算每干一个任务要花多少钱,会算工程师调用一晚上账单会涨多少。当 SpaceXAI 拿着 0.84 美元/任务的价格站到牌桌上时,Anthropic 和 OpenAI 就只能跟着卷。

这不是技术问题,这是商业问题。5 月还在 17 名的 Grok,3 个月就追到和 GPT-5.6 Sol 扳手腕——这事本身就说明:这一轮,牌桌已经被重新洗过了。

9 月,SpaceX 的 AI 收入会正式超过它所有的火箭和卫星业务。Grok 4.7 会在 4.6 的肩膀上,再加一把 Cursor 和 SpaceX 自己的工程数据。剩下的悬念只有一个:当价格、模型、算力、入口都站在同一边时,Anthropic 和 OpenAI 的护城河,到底还剩多深?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注