
六周之内,谷歌发布了第三款Flash模型。
北京时间9月2日凌晨,Gemini 3.8 Flash正式上线。距离3.7 Flash发布仅过去三周,距离3.6 Flash发布不过一个半月。谷歌显然要把小步快跑的战略贯彻到底——但问题也来了:按这个速度,Gemini 4出来之前,3.x的版本号还够用吗?
从官方公布的基准测试来看,3.8 Flash的成绩单相当亮眼。
在长程软件工程测试DeepSWE v1.1中,3.8 Flash拿到73.7%,距离Claude Opus 5的74.0%只差0.3个百分点。而一个半月前的3.6 Flash只有49%。在Terminal-Bench 2.1上,3.8 Flash以89.4%的成绩略超Opus 5的89.1%。HLE-Verified综合推理中,3.8 Flash得分54.9%,高于Opus 5的54.4%。
更令人惊讶的是价格。3.8 Flash的输入输出定价与3.7 Flash完全一致:每百万Token输入0.75美元、输出3.75美元。相比Opus 5输入5美元、输出25美元的价格,Gemini 3.8 Flash整体价位只有后者的15%左右。
谷歌在官方博客中解释,3.8 Flash之所以能完成更困难的任务,是因为它更加努力——面对复杂问题时,它会执行更多推理步骤、反复调用工具、检查自己的工作。3.8 Flash在14项基准测试中拿下8个第一,在Artificial Analysis智能指数上取得59分,与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平。
跑分好看,不代表好用。
爱范儿的实测发现,3.8 Flash生成3D直升机模型只用不到两分钟,但打开看结果,机身细节、部件关系和运动方式都相当粗糙。跑是能跑,但和H145直升机的关系约等于鸡仔饼与鸡仔的关系。另一项3D水流模拟测试中,同样两分钟做出来,但火山口明显在漏水。
这类结果的微妙之处在于:它在工程上确实不是完全失败,任务能结项,代码通常能运行,功能也齐全,但显然离官方演示有着肉眼可见的距离。首批用户反馈也出现了类似分裂:响应速度普遍得到认可,但在真实编程和生成任务中依然容易草率理解需求,迅速交出一个形式完整、但细节一塌糊涂的结果。
问题出在测试方式上。官方演示里,3.8 Flash是在Antigravity中通过循环指令持续工作,并调用Nano Banana生成纹理。换句话说,谷歌展示的是3.8 Flash被整套技术栈托举之后的上限;用户接触到的,是模型单独工作时的下限。
更现实的问题是账单。Artificial Analysis实测发现,3.8 Flash完成同一个任务的总成本涨了40%——模型每个任务多消耗了30%的输出token。价格表没动,账单动了。而且这个优惠价只持续到今年年底,2027年1月1日起单价将翻倍。用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。
Gemini 3.5 Pro的多次跳票让谷歌不得不暂时放弃了Pro市场。DeepMind新掌门人Koray Kavukcuoglu上任后强调要加快执行速度。在Gemini 4到来之前,Flash要负责守住用户、产品、开发者和收入。
3.8 Flash的发布还赶上了一个微妙的时机。就在前一天,Anthropic刚刚完成了Fable 5.1和Mythos 5.1的灰度测试。同一天,Meta也发布了Muse Spark 1.3。三巨头几乎在同一时间窗口内完成了一次模型迭代。
这场竞赛的核心正在从每token价格切换到每任务成本。3.8 Flash虽然单任务成本涨了40%,但每项任务约0.58美元的成本仍然落在智能-成本性价比的前沿上。对于需要大规模部署通用型智能体的企业来说,这个价格依然有吸引力。
谷歌还同步发布了Gemini 3.8 Flash Cyber,专攻网络安全领域。在CWE-Bench漏洞修复测试中达到47.2%,与Fable 5基本持平。这款模型目前通过Fairwind计划仅向受信任的安全团队开放。
退出最强模型的消耗战,可能是一门更轻松的生意。但这也意味着,在Gemini 4真正出现之前,为谷歌技术力代言这项工作只能由Flash强行顶上。3.8 Flash成了一款绝无仅有的奇怪模型——它既要足够快、足够便宜,塞进搜索、手机和十亿人的日常;又要像旗舰模型一样长时间工作、反复调用工具。