Grok 4.6:追平发生在一张综合指数上,卖点却是长任务
8 月 12 日 Cursor 与 xAI 同日放出 Grok 4.6。Artificial Analysis 综合指数与 GPT-5.6 Sol 同为 61。API 起步价仍是输入每百万 token 2 美元、输出 6 美元。长任务是产品句,不是这张表的每一行。
8 月 12 日,Cursor 和 xAI 把 Grok 4.6 放在同一天。Cursor 的写法是与 SpaceXAI 一起放出,x.ai 的发布页标题也挂着 SpaceXAI。定价没有被改写成新故事:起步是输入每百万 token 2 美元,输出 6 美元,另有一个快两倍价钱的 fast 变体。故事改在拿去和谁比。发布页说,它在 Artificial Analysis 的综合指数上与 GPT-5.6 Sol 持平。那张表自己写着,两边都是 61。Fable 5 是 62。
值得站住的不是又一个「追平」。是追平只发生在这一行,卖点却被放在长任务和视觉交互上。
TL;DR:综合指数打平 GPT-5.6 Sol,是九项合成的一个数。同一张表上,DeepSWE 和 Terminal-Bench 仍是 Sol 更高。$2/$6 让比较发生在同一档账单里,不替长任务收敛做担保。
同一天进编辑器,间隙没有了
xAI 发布模型,Cursor 当天就能用,另外还有 Grok Build、API,以及 OpenRouter、Vercel、Cloudflare。两件事叠在一起,交付位置就变了。聊天框里的旗舰,用户拿来问。编辑器里的旗舰,用户拿来改代码、看界面、把多步计划做到可以停下来检查。聊天失败是一句坏答案。编辑器里的长任务失败,是一串已经发生的工具调用,一次看错的界面,或一个跑了很久却没有收敛的过程。
所以长程代理不是形容词。它是说评估的单位从一道题变成一段过程。过程需要视觉,是因为要做的事不全是纯文本:报错在终端里,状态在点击之后才出现。发布页把长任务和更强的视觉交互写成主场,等于承认旗舰竞争已经离开纯文本的智力展示。还在用一道更难的数学题解释这次发布的人,用的是上一阶段的标尺。
同日也意味着,发布说明和编辑器里的可用性没有被拆成两个季度。第一眼看到的不是示范题,而是它能不能待在一个会改文件、会看屏幕的环境里。第一周,Cursor 和 Grok Build 里还有双倍的包含用量。试用的窗口被价格和额度一起打开了。
指数打平,表的其他行没有一起打平
数学题的好处是短,短就可以公开、复算、争论标准答案。长任务的难处是世界在变:界面会改,工具返回不稳定,任务说明里本来就有含糊。含糊是代理的卖点,它声称能在含糊里继续做。含糊也让「追平」几乎无法被外人一次性验收。
Artificial Analysis 的综合指数比只贴实验室自己的内表强。xAI 写明它是九个基准的合成。合成的用处是宣布持平的时候很好用。队列里没有这个数。队列里只有某一次视觉状态看错之后的重试,某一次长计划在中途丢掉约束,某一次它确实更早做完。
他们自己贴出的表,已经把合成和单项拆开了。DeepSWE v1.1,Grok 4.6 是 65.9%,GPT-5.6 Sol 是 73%。Terminal-Bench v3.0,26% 对 34.6%。CursorBench v3.2 上 Grok 是 69.9%,Sol 是 67.2%,Fable 5 是 70.5%。发布把「追平」解释成长任务和视觉,等于主动把举证责任从总分挪到过程。这是更难的举证责任。诚实不会自动带来证据。证据要在编辑器里重新产生。综合指数若靠许多短项加在一起打平,它完全可以在总分上持平,同时在「能一直跑」上并不持平。表上那两行编码代理的落后,就是这个可能,不是外界的猜测。
价格让这些比较发生在同一档账单里。起步价停在 $2 和 $6,追平才可能进入日常队列,而不是只存在于演示。「起步」这个词也该留着。发布页没有把所有上下文长度都收成这一个价,fast 变体是两倍。长任务的账单由步数乘起来,输出又往往更贵。价位清楚,不等于任意长度的一次长跑都是这个单价。
卖点从智商挪走之后,风险留在过程里
卖点若是更聪明,安全讨论还会停在它会不会说出不该说的话。卖点若是跑得更长、看得见图、在编辑器里动手,讨论就得走进过程。长任务给错误更多步。视觉给错误一个新入口:屏幕上的文字、按钮和看似来自系统的提示,都会变成输入。编辑器给错误一个落点:文件和命令,不只是气泡里的句子。
这一天能核对的,是交付位置、起步价、fast 变体,以及综合指数上 61 对 61。核对不到、因而不该被发布句自动补上的,是长任务中途谁能把它停下来,视觉步骤里它如何对待画面中的指令,以及追平旗舰是否也包括在滥用能力上的追平。发布页只说安全措施按能力做了校准,部署前的测试范围是他们自己说的「最广的一次」,并有部署后的第三方测试。范围是声称。结果不是一张你能复算的事故表。
把卖点从智商改走,不意味着风险变小。它意味着风险的形状变了。相关的问题是过程是否收敛,以及收敛的路上它碰过哪些不该碰的东西。综合指数可以当起点。DeepSWE 和 Terminal-Bench 上的差距说明,它还不是终点。