澎湃新闻 2026-08-13 14:45:04
马斯克旗下SpaceXAI发布新一代大模型Grok 4.6,将重点进一步转向长时间运行的AI智能体(AI Agent)。
巧合的是,中国大模型企业DeepSeek同步推出V4 Pro正式版,两款聚焦AI智能体赛道的前沿模型形成正面同台竞技。
当地时间8月12日,SpaceXAI发布Grok 4.6。SpaceXAI表示,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现,以及处理更复杂的交互式、视觉和知识工作任务的能力。
此次发布距离Grok 4.5亮相仅一个多月。7月8日,SpaceXAI刚刚发布Grok 4.5,并将其定位为面向编程和AI智能体任务的模型。
Grok 4.6发布后获市场积极反馈,美股周三收盘,SpaceX股价涨超9%。
性能进入第一梯队
从第三方测试来看,Grok 4.6已经重新进入前沿大模型竞争的第一梯队。
全球知名独立AI大模型评测机构Artificial Analysis公布的Artificial Analysis Intelligence Index显示,Grok 4.6得分为61分,与OpenAI的GPT-5.6 Sol处于同一水平,相比上一代Grok 4.5提高5分。Artificial Analysis称,Grok 4.6由此重新进入前沿模型行列。
四款前沿模型 Artificial Analysis 综合智能指数对比不过,Grok 4.6对比Anthropic旗下的Fable 5未能有碾压态势。
从完整测试结果来看,Grok 4.6在部分智能体和知识工作相关测试中表现突出,但在一些软件工程、终端操作等测试中,Fable 5仍然领先。
SpaceXAI 官方公布 Grok 4.6 与主流前沿模型基准测试对比这一点也使此次升级的意义更加清晰。有分析称,SpaceXAI 的目标不只是冲击传统问答类基准榜单,而是打造能够独立承接连续复杂任务的模型。
从“回答问题”转向“完成任务”
SpaceXAI此次特别强调了Grok 4.6的长流程智能体能力。
例如,用户要求开发一个软件,模型需要自行理解需求、编写代码、运行测试、发现问题,再修改代码,而不是每一步都等待用户下达新的指令。
SpaceXAI表示,Grok 4.6针对这类长时间运行任务进行了专门训练,包括软件工程、研究分析、STEM以及其他知识工作,同时增加了模型生成的推理数据和高质量工程数据。
软件工程是此次Grok 4.6升级的核心应用场景之一。
SpaceXAI表示,新模型经过针对复杂工程任务的强化训练,覆盖内核优化、网页开发、计算机辅助设计等任务。
这也是目前全球AI产业竞争最激烈的方向之一。OpenAI、Anthropic、谷歌等公司都在推动AI从代码补全工具向能够独立承担软件开发任务的智能体演进。
此前,马斯克也曾在演讲中强调,SpaceXAI的策略则是把Grok与自身庞大的技术体系结合起来。
在马斯克的规划中,随着Grok进入SpaceX体系,其潜在应用范围已经不再局限于一个独立的聊天机器人产品,而可以进一步延伸到SpaceX自身的工程研发、软件开发以及其他业务场景。这也是SpaceXAI的优势所在:拥有SpaceX的计算基础设施、工程场景和资本支持。
从产业角度看,AI大模型竞争正在越来越依赖“模型+算力+数据+应用场景”的综合能力。
有分析指出,Grok 4.6的发布折射出整个AI产业正在发生的变化。近年大模型竞争早期焦点集中在参数规模、通用推理与各类基准跑分;随着前沿模型能力逐步收敛,行业竞争重心正向落地应用层转移。谁能够让AI真正完成软件开发、研究分析、数据处理和企业流程,谁就更有可能获得稳定的商业收入。
下一个战场AI智能体
Grok 4.6发布同期,DeepSeek推出V4 Pro正式版,两款模型更新重心均聚焦长流程AI智能体方向。从公开信息来看,Grok 4.6上下文窗口上限500K Token,支持图文多模态输入;DeepSeek V4 Pro上下文窗口可达1000K Token,最大输出384K Token,为文本模型。
在能力优化上,Grok 4.6重点强化科研分析、复杂STEM与高端软件工程任务;DeepSeek V4 Pro侧重代码工程、终端自动化等场景。二者依托不同技术路线与生态体系面向开发者开放选型。
根据DeepSeek给出的模式测试对比成绩,V4-Pro-0813在AI编程智能体基准测试DeepSWE中得分为62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试Automation Bench中甚至超越目前公认最强大的Claude Fable 5。
商业化方面,Grok 4.6已经通过API向开发者开放,并接入包括OpenRouter、Vercel和 Cloudflare等平台,同时进入Cursor和Grok Build等开发工具。
AI Agent与传统聊天机器人相比,需要消耗更多Token,因为一个复杂任务往往需要模型进行多轮推理、调用工具、读取文件并反复修改结果。因此,对于Agent开发者而言,模型性能之外,Token成本同样直接影响最终产品能否实现商业化。
价格方面,Grok 4.6 API 输入价格为2美元/百万token,输出价格为6美元/百万token。Artificial Analysis称,Grok 4.6在达到前沿模型水平的同时,其价格仍具有明显竞争力。
对比之下,V4-Pro模型输入(缓存未命中)3元/百万Token、输出6元/百万Token。但值得注意的是,DeepSeek此前已发布公告,预告近期将整体上调API定价,预计涨幅较大。涨价落地后二者成本竞争格局或将重塑。
责编:邓玉娇
一审:周杨
二审:唐能
三审:苏莉
来源:澎湃新闻
我要问

下载APP
报料
关于
湘公网安备 43010502000374号