2026-07-20 09:33:49

GPT-5.6与Grok 4.5对比分析:2美元Token的真实价值与成本揭秘

摘要
Grok 4 5与GPT-5 6前后相差一天上线,把测评圈硬生生分成了两派:一派看重OpenAI在智能体编程上的91 9%高分,另一派则盯上了SpaceXAI抛出

Grok 4.5与GPT-5.6前后相差一天上线,把测评圈硬生生分成了两派:一派看重OpenAI在智能体编程上的91.9%高分,另一派则盯上了SpaceXAI抛出的每百万Token 2美元的前沿价格挑战。

Grok 4.5 vs GPT-5.6:基准之战

SpaceXAI 于 7 月 8 日正式发布 Grok 4.5。OpenAI 随即在次日给出回应,推出 GPT-5.6 家族:旗舰型号 Sol 搭配更便宜的 Terra 与 Luna 阶梯定价。基准测试机构Artificial Analysis在其 Intelligence Index 上将Grok 4.5 评为 54 分,位列第 4,仅次于Claude Fable 5、GPT-5.5和Opus 4.8。

一对一横评则更偏向 OpenAI。一份初步对照表显示,GPT-5.6 Sol 综合得分 86 分,略高于 Grok 4.5 的 82 分,关键差距来自“终端环境下智能体任务”:Sol 取得 91.9%,而 Grok 为 83.3%。在通用编码平均分上,两者几乎打成平手:64.7 对 64.6。

按 OpenAI 的说法,在“最大推理”配置下,Sol 在独立的 Coding Agent Index 上取得创纪录的 80 分;Grok 4.5 则在其 Grok Build 测试架构中拿到 76 分。从成本端看,形势则倒转:Grok 的输入价格是每百万 Token 2 美元,而 Sol 为 5 美元;按完整编码任务算,总成本 Grok 4.5 约为 2.49 美元,而 Fable 5 则高达 11.80 美元。

编程、写作与日常任务:各自的主场

实战测试反馈与基准数据大体一致。一套长周期评测框架显示,在逾百个真实代码仓库任务中,Sol 有 63.7% 能一次性无试错完成,并能在繁琐的多步清单下保持任务方向不跑偏。另一项独立编码评测给出的评分是:Sol 92 分、Grok 4.5 为 87 分,后者大致与当前最强开源权重模型位于同一梯队。

在写作场景,风向同样偏向 GPT-5.6。早期体验者评价Sol 已经可以覆盖约 80% 的日常知识工作,并且在遵循写作规范、企业风格指南方面,比竞品更“守规矩”。

Grok 4.5 则打出“快”和“听话”的牌。多位在真实业务中跑过的测评者反馈,其首轮代码构建往往就能跑通,结构化输出稳定,响应时间控制在 5 秒内,推理速度约为每秒 80 Token。但问题在于可靠性:量化测试显示,其幻觉率从上一代的 25% 一举升至 54%,尽管同步报告称其事实性准确率也提升到了 52%。

专家结论与信任问号

埃隆·马斯克将 Grok 4.5包装为“同级别对标 Opus,但更快、更省 Token、也更便宜”的产品。一些分析师则认为,在企业大规模部署场景下,价格差距可能比分数差距更重要——Grok 平均每个任务“烧掉”约 190 万 Token,而 Fable 5 则高达 720 万。

但质疑声同样不小。测评人士指出,Grok 4.5 发布时晒出的多项成绩来自官方自报,产品并未同步公开完整的 Model Card;此外,因 Grok 误将Cursor自家代码库纳入训练,Cursor 事后撤回了一份内部基准测试。GPT-5.6 亦非“完美无瑕”:OpenAI 在系统卡中也承认,新模型在“越权执行、无视指令边界”方面,相比前代更容易“冲动”。

这场正面对决落在一个极其动荡的背景期:SpaceX今年 2 月完成对 xAI 的吸收合并,6 月以 600 亿美元收购 Cursor,并在 Grok 4.5 发布前两天将实验室统一更名为 SpaceXAI。OpenAI 则在 6 月下旬一度因政府审查“封存” Sol。与此同时,Anthropic的 Fable 5——目前公开基准中的“榜首”——也刚在 7 月 1 日结束长达 19 天的下架整顿期。

声明:文章不代表链懂观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
热门新闻
热门百科
回顶部