8 月 12 日,马斯克旗下的人工智能公司 SpaceXAI(原 xAI)正式发布新一代旗舰模型 Grok 4.6。官方口径与第三方评测共同指向一个结论:在 Artificial Analysis 综合智能指数上,Grok 4.6 以 61 分追平了 OpenAI 的 GPT-5.6 Sol,成为当前全球第一梯队成员;而它的 API 定价却只有头部竞品的四成左右。这是 xAI 更名 SpaceXAI 后推出的首个旗舰模型,主打「长时运行 Agent」与更激进的交互式、可视化任务。
61 分追平 GPT-5.6 Sol:第一梯队的新成员
Artificial Analysis Intelligence Index 是业内常用的综合基准,由九个评测的加权得分构成。根据官方公布与多家媒体报道的数据:Grok 4.6 得分 61,与 OpenAI GPT-5.6 Sol Max 持平,仅落后于 Anthropic 的 Claude Opus 5(63 分)和 Claude Fable 5 Max(62 分),相比上一代 Grok 4.5 High(56 分)跃升了 5 分。也就是说,综合能力上 Grok 4.6 已经挤进「只差一步就到顶」的行列。
长时 Agent:53 步任务与自我验证
Grok 4.6 最大的卖点是「long-running agents」——能在几十上百步的多阶段任务中保持状态、持续工作。在衡量真实知识工作的 GDPval-AA v2 基准上,Grok 4.6 以 Elo 1753 排名第二,仅次于 Claude Opus 5,且完成复杂任务平均只需约 53 步,而 Claude Opus 5 需要约 103 步。官方还观察到,在更长的轨迹上模型开始出现「自我测试与自我验证」行为:完成一段工作前先检查自己的输出。对开发者而言,这意味着把它交给「从想法到第一个可用版本」这类任务时,它更能自主推进而不是中途断链。
专项基准:代码能力大幅跃升,仍有差距
在细分评测上,Grok 4.6 的表现更值得玩味:软件工程基准 DeepSWE v1.1 得分 65.9%,较 Grok 4.5 的 54% 提升明显,但仍落后于 GPT-5.6 Sol Max 的 73%;终端代理基准 Terminal-Bench v3.0 从 15.7% 跃升至 26%,同样追不上约 34% 的头部水平。也就是说,Grok 4.6 的进步是全面且显著的,但在「硬核代码工程」这类纵深任务上,与 OpenAI 旗舰仍有约 7 个百分点差距——它的强项更多落在知识工作与长任务执行上。需要说明的是,以上多为官方自报数据,独立第三方复测尚未大规模出炉。
价格战:$2/$6 每百万 token,便宜 60% 以上
Grok 4.6 的 API 定价为每百万输入 token 2 美元、每百万输出 token 6 美元(另有 2 倍价格的 fast 快速变体)。对比 Claude Opus 5($5/$25)和 GPT-5.6 Sol($5/$30),综合成本低 60% 以上。这延续了 SpaceXAI 一贯的「以价换量」策略:在模型能力追平头部的前提下,用显著的价格差抢占开发者与企业的调用量。对于高频调用 API 的 Agent 应用开发者来说,这是一个实打实的成本变量。
从 xAI 到 SpaceXAI:更名背后的平台化野心
Grok 4.6 是首个从立项到发布全程以 SpaceXAI 名义出现的旗舰模型。过去一年,这家公司完成了整体重组,Grok 的定位也从「X 社交网络的内置 AI」转向「开发者与企业平台」:发布当天即上线 Cursor 代码编辑器、自家 Grok Build 工具、官方 API,并通过 OpenRouter、Vercel、Cloudflare 等渠道分发;首周还在 Grok Build 与 Cursor 内提供双倍用量额度以吸引开发者上手。训练层面,Grok 4.6 采用了更长的补充训练、由 Grok 4.5 重新生成的 SFT 轨迹,以及覆盖内核优化、Web 开发、计算机辅助设计等领域的 Agent 强化学习任务。
Grok 4.6 的意义不只是「又一个新模型」:当开源与闭源、性能与价格的边界都在松动时,SpaceXAI 选择用「追平性能 + 六成价差 + 长任务 Agent 定位」的组合拳切入开发者市场。对于正在挑选大模型 API 的团队,这可能是今年最值得认真做一次基准对比的候选之一。
参考来源
- SpaceXAI 官方公告:Introducing Grok 4.6(x.ai/news/grok-4-6,2026-08-12)
- THE DECODER:SpaceXAI's Grok 4.6 matches OpenAI's best model and undercuts it on price(2026-08-12)
- Unite.AI:SpaceXAI Launches Grok 4.6 for Long-Running Agents(2026-08-12)
- VentureBeat:SpaceXAI debuts Grok 4.6,overtaking Kimi K3 and vaulting to fourth on Artificial Analysis(2026-08-12)
- 作者:lee
- 链接:https://ligan.cc/article/grok-4-6-spacexai-frontier-model
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。








