
专家说| 马斯克旗下Grok 4.6突围启示:AI 竞争从"个人英雄"走向“体系战争”

核心摘要:
1. 在原始联创团队大规模流失之后, xAI仍凭借Grok 4.6重新进入全球前沿模型第一集团。
2. 这轮追赶背后,更值得关注的是AI研发生产函数的变化:超大规模算力、真实工作流数据、强化学习环境、自动评测以及模型参与模型研发,正在共同构成新的竞争壁垒。
3. 前沿AI的竞争,可能也由明星研究员之间的较量,进一步演变为整套研发体系和组织能力之间的竞争。
独家专栏作者 张致鹏

(张致鹏,美国印第安纳伯明顿大学公共管理学硕士、哈工大博士,深圳高质量发展与新结构研究院助理研究员,中信基金会特邀研究员,擅长公共政策、宏观经济、AI产业、国际关系研究,在顶级期刊发表论文多篇、出版《深圳生长:土地与城市更新》等著作四部)
在人工智能行业,核心研究人员的流动通常被视为判断一家实验室技术前景的重要先行指标。按照这一标准,xAI过去一年的情况并不乐观。
2026年以来,其原始联创团队持续流失,到3月底,除马斯克之外的原始联创已基本全部离开,其中包括多名直接参与模型训练、推理和工程体系建设的核心技术人员。
按照传统科技公司的经验,如此剧烈的人才变动往往意味着研发能力受到明显冲击。但随后发生的事情颇值得研究:Grok并未明显掉队,Grok 4.5之后又很快推出Grok 4.6,并重新进入全球前沿模型的第一集团。
从目前公开评测看,Grok 4.6已经具备与OpenAI、Anthropic最强模型正面竞争的能力。
以Artificial Analysis近期综合评测为例,Grok 4.6 High的Intelligence Index达到61,与GPT-5.6 Sol处在同一水平,仅略低于Claude Opus 5等少数模型。在软件工程、复杂知识工作和长程Agent任务上,它的表现尤其突出。
与此同时,xAI依然维持了相对激进的API定价,因此,目前Grok 4.6一个相当突出的特点,是性能与调用成本之间形成了较好的组合。
当然,这并不意味着它已经在所有维度领先。一般对话偏好、部分代码测试以及响应延迟等指标上,Grok仍有明显短板。
更准确地说,xAI已经重新获得了“frontier lab”的竞争资格,而且这种追赶发生在核心创始团队大规模离职之后,这才是Grok 4.6最值得关注的地方。
理解这一现象,需要重新认识今天前沿AI实验室的“生产函数”。几年前,一家AI公司的技术能力在很大程度上可以归结为它拥有多少顶尖研究员,以及这些研究员能否提出新的模型结构、训练方法和算法。
随着大模型进入工业化阶段,这种解释已经越来越不完整。真正决定模型迭代速度的资产,开始同时包括算力基础设施、分布式训练系统、已有模型权重、训练数据、强化学习环境、自动评测系统、推理基础设施,以及模型自身参与研发的能力。人才仍然关键,但大量研发能力正在从个人经验沉淀为组织资本和工程系统。xAI恰好提供了一个非常典型的案例。
其中第一项基础资产是Colossus。xAI此前已经完成了规模极大的GPU集群建设,并围绕大规模训练建立了相应的网络、调度、checkpoint和分布式训练体系。
更重要的是,从Grok 4开始,xAI已经尝试把强化学习的计算规模推到接近预训练的量级。传统意义上的RL主要集中于有限的数学、代码或人类偏好任务,而新一代前沿模型越来越依赖大规模、可自动验证的训练环境,让模型在软件工程、搜索、工具调用、知识工作等任务中反复试错。
基础设施一旦完成,其价值就不会随着几个核心研究员离职而消失。模型权重、代码、训练管线、数据处理系统和评测框架都属于可以持续积累的组织资产。这也是为什么核心人员流失会带来损失,却未必立刻导致模型能力断层。
第二个因素可能更加重要,即xAI与Cursor之间形成的深度结合。公开资料显示,Grok 4.5的训练已经大量使用Cursor环境中的真实开发数据,其中包括开发者如何理解代码库、如何调用工具、如何修改代码、如何处理失败以及如何完成任务。
这个区别非常重要。传统代码模型主要学习的是“代码本身”,而Cursor能够提供的是完整的“工作过程”。对于正在向Agent发展的模型而言,后者往往具有更高价值。因为真正困难的问题已经逐步从“模型会不会写一段代码”,转向“模型能否在一个真实的软件工程环境中持续工作数小时,理解上下文,调用不同工具,在失败之后自行修正,并最终完成一个复杂任务”。这类数据很难从公开互联网中直接获得,却恰恰是Cursor这样的AI原生开发工具能够持续产生的。
由此进一步出现了一个值得关注的变化:模型开始参与下一代模型的研发过程。
根据双方公开披露的信息,Cursor和xAI已经使用大量Agent自动构造和测试强化学习环境,一部分过去需要大量工程师人工完成的工作,可以由模型辅助执行。在Grok 4.6的训练中,上一代Grok 4.5还被用于生成新的SFT训练轨迹,再通过自动化检查筛选高质量样本。更早期的Grok 4.6 checkpoint甚至被用于优化自身推理系统,在数小时内测试数百种代码修改,并有部分修改最终进入生产环境。
距离严格意义上的“递归自我改进”仍然很远,但一个更现实的AI研发闭环已经逐渐形成:上一代模型参与生成训练数据、构造测试环境和改进基础设施,从而降低下一代模型研发的边际成本。
这也解释了为什么Grok 4.5到4.6可以在较短时间内取得明显提升。Grok 4.6仍属于同一大型模型家族,其进步相当一部分来自补充训练、更加优质的工程数据、SFT轨迹、强化学习环境以及训练和推理配方的改进。换言之,今天模型能力的提高越来越依赖“post-training factory”,即一套能够持续生成数据、设计任务、验证结果并更新模型的后训练体系。
过去行业竞争最受关注的问题是“谁能训练更大的基础模型”,未来同样重要的问题将是“谁能够更高效地把已有基础模型训练成可靠的Agent”。如果这一趋势持续,那么拥有真实用户工作流的平台,其战略价值会明显上升。Cursor之于xAI,可能正是这样一种资产:它同时提供用户入口、真实任务、行为数据、Agent环境和反馈闭环。
因此,xAI过去几个月真正完成的“追赶”,很难简单归因于某一次算法突破。更合理的解释,是它已经建立了一套高度工业化的模型研发体系。Colossus提供算力,已有模型提供基础能力,Cursor提供真实的软件工程环境和数据,大规模RL提供持续学习机制,自动评测和Verifier降低实验成本,上一代模型则开始承担部分研发工作。
马斯克式的高强度组织方式进一步压缩了资源配置和决策周期。在传统企业中,发现某项技术能力不足,往往需要经过招聘、团队建设和长期研发;xAI的做法更加激进:缺少某一种能力,就迅速引入相关团队、平台和数据,再将其整合进现有训练系统。这种模式的执行效率很高,其组织成本同样十分明显,大规模人员离职本身就是代价之一。
Grok 4.6因此提供了一个比模型排行榜更值得讨论的信号:前沿AI竞争正在逐渐从“少数明星研究员之间的竞争”,进入算力、数据、训练环境、Agent平台和自动化研发体系之间的综合竞争。个人仍然重要,尤其在基础研究、算法创新和技术方向判断上,顶级研究人员的作用很难被简单替代;但一家AI实验室的能力已经越来越多地沉淀在模型、代码、数据、基础设施和组织流程之中。这意味着,创始团队离职与模型继续进步完全可能同时发生。
当然,现在还不能据此判断xAI的组织模式已经获得长期验证。人员持续流失可能对基础研究能力、技术路线多样性和长期创新产生滞后影响,而目前Grok的进步仍然可以部分利用过去团队留下的模型、代码和训练体系。
真正的检验可能要等到Grok 5以及更后续的模型:当早期创始团队留下的技术积累逐渐被消耗之后,新团队、Cursor体系和AI辅助研发机制能否继续产生原创性的前沿突破。
如果答案是肯定的,那么Grok 4.6的意义将远远超过一次模型排名的上升。它可能意味着,前沿AI研发正在形成一种新的产业组织形态:研发能力越来越能够被基础设施化、平台化和自动化,而这将重新定义未来AI公司的核心竞争力。
完整产业数据报告、市场趋势分析,移步「产联社」客户端
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


