
Grok 4.5 与 GPT-5.6 前后相差一天上线,把测评圈硬生生分成了两派:一派看重 OpenAI 在“智能体编程”上的 91.9% 高分,另一派则盯上了 SpaceXAI 抛出的“每百万 Token 2 美元”前沿价格挑战。
Grok 4.5 vs GPT-5.6:基准之战
SpaceXAI 于 7 月 8 日正式发布 Grok 4.5。OpenAI 随即在次日给出回应,推出 GPT-5.6 家族:旗舰型号 Sol 搭配更便宜的 Terra 与 Luna 阶梯定价。基准测试机构 Artificial Analysis 在其 Intelligence Index 上将 Grok 4.5 评为 54 分,位列第 4,仅次于 Claude Fable 5、GPT-5.5 和 Opus 4.8。
一对一横评则更偏向 OpenAI。一份初步对照表显示,GPT-5.6 Sol 综合得分 86 分,略高于 Grok 4.5 的 82 分,关键差距来自“终端环境下智能体任务”:Sol 取得 91.9%,而 Grok 为 83.3%。在通用编码平均分上,两者几乎打成平手:64.7 对 64.6。
按 OpenAI 的说法,在“最大推理”配置下,Sol 在独立的 Coding Agent Index 上取得创纪录的 80 分;Grok 4.5 则在其 Grok Build 测试架构中拿到 76 分。从成本端看,形势则倒转:Grok 的输入价格是每百万 Token 2 美元,而 Sol 为 5 美元;按完整编码任务算,总成本 Grok 4.5 约为 2.49 美元,而 Fable 5 则高达 11.80 美元。
编程、写作与日常任务:各自的主场
实战测试反馈与基准数据大体一致。一套长周期评测框架显示,在逾百个真实代码仓库任务中,Sol 有 63.7% 能一次性无试错完成,并能在繁琐的多步清单下保持任务方向不跑偏。另一项独立编码评测给出 的评分是:Sol 92 分、Grok 4.5 为 87 分,后者大致与当前最强开源权重模型位于同一梯队。
在写作场景,风向同样偏向 GPT-5.6。早期体验者评价 Sol 已经可以覆盖约 80% 的日常知识工作,并且在遵循写作规范、企业风格指南方面,比竞品更“守规矩”。
Grok 4.5 则打出“快”和“听话”的牌。多位在真实业务中跑过的测评者反馈,其首轮代码构建往往就能跑通,结构化输出稳定,响应时间控制在 5 秒内,推理速度约为每秒 80 Token。但问题在于可靠性:量化测试显示,其幻觉率从上一代的 25% 一举升至 54%,尽管同步报告称其事实性准确率也提升到了 52%。
专家结论与信任问号
埃隆·马斯克将 Grok 4.5 包装 为“同级别对标 Opus,但更快、更省 Token、也更便宜”的产品。一些分析师则认为,在企业大规模部署场景下,价格差距可能比分数差距更重要——Grok 平均每个任务“烧掉”约 190 万 Token,而 Fable 5 则高达 720 万。
但质疑声同样不小。测评人士指出,Grok 4.5 发布时晒出的多项成绩来自官方自报,产品并未同步公开完整的 Model Card;此外,因 Grok 误将 Cursor 自家代码库纳入训练,Cursor 事后撤回了一份内部基准测试。GPT-5.6 亦非“完美无瑕”:OpenAI 在系统卡中也承认,新模型在“越权执行、无视指令边界”方面,相比前代更容易“冲动”。
这场正面对决落在一个极其动荡的背景期:SpaceX 今年 2 月完成对 xAI 的吸收合并,6 月以 600 亿美元收购 Cursor,并在 Grok 4.5 发布前两天将实验室统一更名为 SpaceXAI。OpenAI 则在 6 月下旬一度因政府审查“封存” Sol。与此同时,Anthropic 的 Fable 5——目前公开基准中的“榜首”——也刚在 7 月 1 日结束长达 19 天的下架整顿期。
本文链接地址:https://www.wwsww.cn/rgzn/40052.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。



