SpaceXAI 于 8 月 12 日正式发布了全新升级的旗舰级 AI 模型 Grok 4.6。该模型专为处理复杂、长程的 Agent 任务打造,并在多项基准测试中展现出媲美甚至超越 OpenAI 旗舰模型 GPT-5.6 Sol 的强劲实力。

此前在 7 月份,SpaceXAI 曾联合 Cursor 推出 Grok 4.5 模型。该模型在数万张 NVIDIA GB300 GPU 的算力支持下完成训练,性能仅次于 Anthropic 的 Fable 5 和 OpenAI 的 GPT-5.6 Sol,且具备极高的性价比。而本次推出的 Grok 4.6 在此基础上实现了进一步飞跃,训练过程重点针对长程复杂任务进行了优化,采用了精选的模型生成数据,涵盖推理能力、高级技术概念以及高质量工程代码。此外,模型还接受了包括知识工作、通用编程及多个领域专属环境在内的广泛 Agent 强化学习训练,这使其在构建视觉和交互式应用时能够提供更优秀的初始效果。
根据 Artificial Analysis 涵盖九项热门 AI 基准测试的综合指数显示,Grok 4.6 的成绩已追平 GPT-5.6 Sol,仅落后于 Claude Opus 5 与 Fable 5 Max。在评估逻辑与知识水平的 GDPval-AA v2 测试中,Grok 4.6 取得了 1753 的 Elo 得分;而在衡量长时程知识工作 Agent 任务的私有基准测试 AA-Briefcase 中,其 Elo 得分也达到了 1577 分,两项表现均仅次于 Claude Opus 5。
在性能显著提升的同时,Grok 4.6 依然保持了极具竞争力的速度与价格体系。该模型的运行速度为 80 TPS,基础版本的输入与输出价格分别为每百万 Token 2 美元和 6 美元,高速变体版则为每百万 Token 4 美元和 12 美元。目前,Cursor 与 Grok Build 用户已可直接体验该模型,开发者也可通过 API 进行接入。为庆祝新模型上线,SpaceXAI 还面向 Grok Build 与 Cursor 用户推出了限时优惠活动,首周内可享受双倍使用额度。


