【科技知识NOW】Grok 4.6发布…与GPT并列,4.7也已预告

Photo of author

By Global Team

图=Grok
图=Grok

埃隆·马斯克的AI公司SpaceXAI于12日(当地时间)发布了新的AI模型Grok 4.6。该模型重点强化了“长时间工作”的能力。SpaceXAI表示,Grok 4.6被设计用于完成资料检索、信息分析、代码处理、应用程序制作等需要经过多个步骤的复杂任务。

◆ 从问答型AI走向任务执行型AI

Grok 4.6瞄准的市场是智能体AI。与只对一个问题给出一个答案的传统聊天机器人不同,智能体AI是指在接到目标后,会自行制定计划、使用工具、检查中间结果,并在无需人工介入的情况下持续推进工作的方式。

SpaceXAI解释称,Grok 4.6在长任务中展现出自主验证的行为,即在进入下一步之前,会先对自己完成的工作进行测试和确认。公司还介绍,它在接到产品创意后,能够调查陌生领域、搭建结构并实现核心功能,最终输出可运行的首个版本。

Grok 4.6 High的主要AI基准比较结果。(来源=SpaceXAI)
Grok 4.6 High的主要AI基准比较结果。(来源=SpaceXAI)

记忆容量也有所提升。Grok 4.6一次可处理50万个token。token是AI处理文本的最小单位,50万个token相当于多部长篇小说的篇幅。这意味着它可以整套读取厚重的合同文件或大型程序代码,并直接交由其执行任务。

价格则与上一代保持一致。API标准下,输入每100万个token为2美元,输出每100万个token为6美元。这被解读为在提升性能的同时锁定价格,以性价比取胜的策略。发布后一周,SpaceXAI还将为自家开发工具提供双倍基础使用量的促销。

◆ 成绩单一看,文书第一、编程偏弱

AI模型的性能通常通过基准测试来比较,这类似于参加多门学科考试后再计算平均成绩的模拟测验。

在综合指标Artificial Analysis智能指数中,Grok 4.6获得61分,比上一代Grok 4.5提高了5分,与OpenAI的GPT-5.6最高版本持平。据VentureBeat报道,目前榜首仍由Anthropic占据,Claude Opus 5位列第一,Claude Paple 5以62分排在第二,而Grok 4.6与GPT-5.6并列第三集团。

Grok 4.6模型以61分达到与GPT-5.6 Sol Max相同水平,并在部分评测中领先竞争模型。(来源=SpaceXAI)
Grok 4.6模型以61分达到与GPT-5.6 Sol Max相同水平,并在部分评测中领先竞争模型。(来源=SpaceXAI)

不过,各项成绩差异明显。在评估实际文档撰写和知识劳动的测试中,Grok 4.6在对比对象中排名第一。相反,在衡量真实软件错误修复能力的实战编程测试中,它以65.9%落后于GPT-5.6的73%和Claude Paple 5的70%。在终端环境任务评估中,也仅达到竞争模型的三分之二左右。

这意味着它在报告整理和办公事务上更强,而在高难度编程实务上相对较弱。由此也可看出,按用途选择不同模型的时代已经到来。

◆ 几周后预告4.7,速度战的利与弊

马斯克已经公开了后续版本的时间表。根据罗伊特新闻等多家外媒报道,马斯克表示将在Grok 4.6发布后的数周内推出Grok 4.7。外界还预测,Grok 4.7的参数规模将达到2.1万亿。

参数可理解为AI“大脑”中的调节装置,数量越多,通常意味着可进行更复杂的判断。若按计划推进,这将是一场在盛夏连续推出两款大型模型的速度战。SpaceXAI正在美国孟菲斯建设、并持续扩建的超大型GPU集群“Colossus”,被认为是这场速度战的底气所在。

不过,围绕快速发布也出现了担忧。外媒指出,AI安全研究者担心,发布速度可能先于验证速度。此外,由于Grok聊天机器人过去曾因不当回答引发争议,分析认为,对企业客户而言,除了性能之外,信任管理也将成为关键。

从用户角度看,模型竞争加剧意味着选择更多。顶级模型之间的分差已缩小到1至2分,价格和用途上的优势正成为选择标准。文书任务多的用户可选Grok,编程实务较多的用户则可选择其他模型。对于把工作交给AI智能体的企业而言,还应同步建立结果验证流程。

如果Grok 4.7如期推出,今夏AI竞争的下一轮就将开启。竞争焦点正从比拼分数,转向谁能工作更久、谁更值得信赖。