首页 / 科技 / SpaceXAI发布Grok 4.6:性能超越Kimi K3 并列全球第三

SpaceXAI发布Grok 4.6:性能超越Kimi K3 并列全球第三

摸鱼不慌
摸鱼不慌

  【CNMO科技消息】马斯克旗下的人工智能公司SpaceXAI日前发布了新一代前沿模型Grok 4.6,重点面向长时间运行的智能体、编程和知识工作场景,并采用更具竞争力的定价策略来降低这些工作负载的运行成本。

SpaceXAI发布Grok 4.6:性能超越Kimi K3 并列全球第三  第1张Grok

  在第三方评测机构Artificial Analysis的智能指数中,Grok 4.6得分61,超越月之暗面的开源模型Kimi K3,与OpenAI的GPT-5.6 Sol Max持平,相比上一代Grok 4.5提升5分。目前榜单前两名分别由Anthropic的Claude Opus 5和Claude Fable 5占据,Grok 4.6与GPT-5.6 Sol Max并列全球第三。

  编程和智能体能力是Grok 4.6升级的重头戏。在DeepSWE v1.1基准测试中,其得分从54%跃升至65.9%;APEX-Agents智能体基准从47.1%升至57.5%,提升10.4个百分点,略超GPT-5.6 Sol Max的56.7%;Terminal-Bench v3.0也从15.7%提升至26%。不过在后两项测试中,Claude Fable 5 Max仍保持领先,说明Grok 4.6虽然进步明显,但尚未实现对竞争对手的全面压制。

  定价方面,Grok 4.6的API起步价为每百万输入token 2美元、每百万输出token 6美元,处于前沿模型的中档价位,不到GPT-5.6 Sol标准模式价格的一半。模型支持50万token的上下文窗口,提示词低于20万token时按上述价格计费,达到20万token后费率将上调。据SpaceXAI介绍,Grok 4.6今日起已在Grok Build中上线,并同步登陆其收购的AI编程公司Cursor,合作方还包括OpenRouter、Vercel和Cloudflare等。

  在训练层面,SpaceXAI表示,相比Grok 4.5,Grok 4.6进行了更长时间的训练,并针对通用编程、知识工作、内核优化、网页开发和计算机辅助设计等智能体环境强化了强化学习。测试中,Grok 4.6在长序列任务中展现出更强的自我测试和验证能力。从成本效率看,Artificial Analysis数据显示,Grok 4.6完成AA-Briefcase工作负载平均仅需约53轮交互和5亿输入token,而Claude Opus 5 Max约为103轮和20亿token,前者的效率优势相当明显。

版权所有,未经许可不得转载