一边是梁文锋凌晨放出DeepSeek V4 Pro正式版,另一边是马斯克砸下新一代旗舰Grok 4.6——两大巨头,同一时间,火药味直接拉满。
北京时间8月12日深夜,DeepSeek官网API文档悄然更新,模型版本从预览版切换至DeepSeek-V4-Pro-0813。几乎同一时间,马斯克旗下SpaceXAI正式发布Grok 4.6。他们盯上的是同一件事——让模型在长任务里持续调用工具、修改代码、验证结果,最终交付一个真正能用的成品。
DeepSeek V4 Pro正式版最亮眼的成绩,是在两项评测中拿下绝对第一。网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1分;自动化任务AutomationBench拿到31.8分,压过Fable 5的29.1分。
最惊险的一战发生在Terminal-Bench 2.1——DeepSeek拿到87.9分,全球第一的Anthropic Fable 5是88.0分,差距只剩0.1分。预览版只有72.1分,正式版直接飙到87.9。软件工程智能体DeepSWE也从预览版的12.8分暴涨到62.7分,接近原来的5倍。
Grok 4.6同样杀入第一梯队。Artificial Analysis智能指数得分61,与GPT-5.6 Sol Max持平,位列全球第三。在知识工作评测GDPval-AA v2中拿下1753 Elo,超过GPT-5.6 Sol Max的1728分和Claude Fable 5的1741分。专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%。
性能之外,定价才是这场对轰的真正爆点。
每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。而DeepSeek V4 Pro仅0.87美元——约为Grok的七分之一、GPT-5.6 Sol的三十四分之一、Fable 5的五十七分之一。
输入方面,DeepSeek V4 Pro缓存未命中定价3元/百万Token,输出6元/百万Token。Grok 4.6每百万输入Token收费2美元,输出6美元。
马斯克的Grok 4.6已经把价格压到了其他前沿模型的一半,但DeepSeek直接打到了地板。
有分析人士感叹:过去开发者只能在用不起和不够强之间艰难选择。今天DeepSeek用仅为SOTA几十分之一的价格掀翻桌子,Grok以极高的性价比紧随其后。顶尖智能不再高不可攀。

跑分之外,第一批真实任务实测已经出炉。
AI博主向阳乔木把相同提示词分别交给两款模型。在Flappy Bird开发测试中,DeepSeek V4 Pro消耗超2万Token,成本仅0.019美元;Grok 4.6只用了约5000 Token,成本却达0.03美元。但从成品看,DeepSeek明显更胜一筹——游戏中不仅有山脉远景和层叠云朵,水管带有渐变与体积感,角色穿过水管时甚至会弹出+1浮动动画。
在另一组前端测试中,DeepSeek V4 Pro再次拿下Grok 4.6。不过V4 Pro也并非场场封神——在一组鹈鹕对比测试中,大象造型更美观,但鹈鹕的运动方向被完全画反了。
几轮实测看下来,两款模型确实已经打到了同一水平线。
马斯克已经提前预告,Grok 4.7马上就来,目标直指超越所有顶尖AI。DeepSeek这边还有一张底牌未出——备受关注的Harness团队公众号已于7月注册,内测用户称参与深度体验两天后愿称之为宇宙最强。
身处这个以小时为单位进化的时代,智能不再是少数巨头的特权。梁文锋的DeepSeek和马斯克的Grok,在同一天共同改写了一条规则:高性能与低成本,可以同时存在。属于所有人的应用大爆发,才刚刚开始。