马斯克:Grok 4.5内测已比肩Opus 今年每月都一个大模型

马斯克:Grok 4.5内测已比肩Opus 今年每月都一个大模型

AI大模型赛道的竞赛正在进入“按月迭代”的恐怖节奏。

6月29日,马斯克在社交平台X上高调宣布,xAI旗下最新一代大语言模型Grok 4.5已在SpaceX和特斯拉内部启动Beta测试,后续将逐步向更广泛用户开放。这不仅是xAI模型矩阵的一次常规升级,更释放出一个强烈信号——马斯克正在以惊人的速度推进AI研发,意图在头部阵营中撕开更大的缺口。

s_702e99f1bad84b3ba15fc9db8780606c

性能实测:已接近或超越Claude Opus

据马斯克透露,早期评测结果显示,Grok 4.5的性能已接近乃至超越Anthropic的旗舰模型Claude Opus。这一成绩背后,是1.5万亿参数规模的V9基础模型作为底座,更值得注意的是,模型在补充训练阶段特别引入了热门AI编程工具Cursor的数据。

Cursor作为当前开发者社区中极具口碑的AI编程辅助工具,其数据注入意味着Grok 4.5在代码理解、生成与调试能力上得到了定向强化。这并非偶然——软件开发与编码辅助正是大语言模型商业化变现最成熟、最直接的场景之一,xAI显然不想在这一领域落后于OpenAI和Anthropic。

马斯克同时强调,强化学习(RL)仍在持续显著提升模型表现,配套的“Grok Build”测试基准也在同步优化完善。这意味着当前的内测版本并非最终形态,后续仍有性能爬升空间。

每月一个“从零开始”的新模型:xAI进入疯狂迭代模式

更具冲击力的信息来自马斯克对后续规划的披露:SpaceX计划在2026年剩余时间内,每月发布一个“完全从零开始训练”的全新AI模型。马斯克特意强调,这些版本将不仅是既有系统的渐进式升级,而更可能是通过全新训练构建的基础模型重构。

这一节奏在AI行业中堪称前所未有。目前业内头部玩家(OpenAI、Google、Anthropic)的主流节奏是每年发布1~2代旗舰模型,中间穿插若干微调或蒸馏版本。而xAI如果真能做到“月月焕新”,意味着其研发管线将承受极端压力——算力调度、数据清洗、训练稳定性、评测验证,每一个环节都必须以工业化流水线的方式运转。

当然,这也可能是马斯克一贯的“激进预期管理”风格——先设定极高目标,即便最终打些折扣,实际落地速度仍可能快于竞争对手。

为何先给SpaceX和特斯拉“吃小灶”?

此次内测选择在SpaceX和特斯拉内部先行部署,用意非常清晰。这两家公司不仅是马斯克商业版图的基石,更是大模型落地最复杂的“真实战场”——SpaceX涉及航天工程、飞行控制、材料科学;特斯拉覆盖自动驾驶、车机交互、智能制造。在这些场景中跑通Grok 4.5,能够积累大量非公开领域的实战反馈,为模型的工程化能力和推理可靠性提供远超普通用户测试的验证价值。

竞争格局:头部AI企业的“军备竞赛”再提速

Grok 4.5的发布与每月一新模型的承诺,直接加剧了xAI与OpenAI、Anthropic、Google之间的竞争张力。当前大模型领域正处于“能力天花板不断被刷新”的窗口期,谁能在推理效率、长上下文、多模态和代码能力上率先突破,谁就有望锁定下一阶段的商业先机。

值得注意的是,马斯克与OpenAI的积怨已深,Grok系列从一开始就被定位为“追求极致推理能力且更少政治正确约束”的替代方案。xAI若能凭借Grok 4.5及后续快速迭代在开发者群体中建立起口碑,将对Cursor、GitHub Copilot等现有编程辅助工具形成直接冲击。

个人观察:速度是优势,但持续性才是关键

在我看来,xAI当前最令人敬畏的不是某一款模型的评测分数,而是其恐怖的迭代速度。从Grok-1到Grok-4.5,xAI用了不到两年时间走完了其他公司三到四年的路。但每月发布一个从头训练的新模型,挑战的不只是技术能力,更是组织管理、算力成本和数据供应链的极限。如果xAI能维持这个节奏到年底,2026年的AI竞赛将不再是“三足鼎立”,而可能演变为“四强争霸”。反之,如果后续出现延期或性能不及预期,舆论的反噬也会同样猛烈。

无论如何,马斯克已经给这桌AI牌局重新洗了牌。接下来的六个月,将是观察xAI究竟是一只“快速成长的黑马”,还是一场“被高估的表演”的关键窗口。

© 版权声明
THE END
喜欢就支持一下吧
点赞5赞赏 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容