北京时间7月10日凌晨,OpenAI正式向公众全面开放GPT-5.6系列模型。旗舰款Sol、均衡款Terra、轻量款Luna三个型号同时登场。但比模型发布更值得关注的,是同一晚发生的另外两件事:Codex独立App正式并入ChatGPT桌面应用,以及一个叫ChatGPT Work的智能体产品同步上线。
GPT-5.6系列采用天体命名:Sol代表太阳,Terra代表地球,Luna代表月亮。三款模型的定价分别为:Sol每百万输入token 5美元、输出30美元;Terra输入2.5美元、输出15美元;Luna输入1美元、输出6美元。
OpenAI这次发布的核心叙事不是更聪明,而是更省。在面向55个行业长程工作流的Agents' Last Exam评测中,Sol拿下53.6分,超过Claude Fable 5达13.1分。即便在中等推理设置下,Sol也比Fable 5高出11.4分,成本约为后者的四分之一。Terra和Luna在约十六分之一的成本下,基准测试得分仍超过Fable 5。
编程是OpenAI重点对标的方向。在Artificial Analysis编程智能体指数上,Sol以80分创下新高,比Fable 5高出2.8分。输出token不到对手一半,耗时减少过半,成本低约三分之一。

模型之外,更大的动作在产品侧。Codex独立App从今天起正式下线,能力全部并入新版ChatGPT桌面应用。原有的ChatGPT桌面版更名为ChatGPT Classic。新的桌面App里,Chat、Work、Codex三种模式装进同一个应用。免费用户也能用,macOS和Windows全球开放下载。
为什么合并?数据给出了答案。Codex每周有超过500万人在用,其中超过100万人拿它干的事跟写代码没关系。OpenAI判断,Codex的能力可以服务更广泛的用户群体。
与此同时,代号Atlas的独立浏览器也被砍掉了。功能转进Chrome侧边栏插件。Atlas从上线到关停,只活了大约九个月。
合并之后的产物叫ChatGPT Work。它不是一个新的聊天模式,是一个能交付结果的智能体。给它一个目标,它会自己拆解步骤、跨应用跨文件地行动,连续工作数小时。最后给的不是一段建议,而是做完的表格、幻灯片、文档,甚至一个可以分享链接的网页应用。
通过插件可以接入Slack、Teams、Google Drive、邮箱、日历和CRM。配合定时任务,它可以在你不在电脑前的时候持续推进项目。
OpenAI内部已经全员用上了这套东西。财务团队做月末对账从几天缩到几小时。销售团队能在24小时内把一次客户对话变成定制化的概念验证,这流程以前要几周。
OpenAI挑在这个时间点发新品,不是随便选的。过去几周,Anthropic因为出口管制问题,Fable 5和Mythos 5的访问一度受限。OpenAI选择在对手被捆住手脚的时候全力出击。
在部分评测中Sol和Fable 5互有胜负。更接近真实的技术社区反馈是,Fable 5的成品完成度更高,但Sol在成本和代码简洁度上更优。有用户比喻说,Sol像一个魅力十足、高效能干的同事,而Fable像个天才隐士,在自己的痴迷领域里无比出色,但不太爱出门。
还有个有趣的细节。GPT-5.5时期那个让模型动不动就聊哥布林的reward hacking问题,官方宣布已在5.6中修复。以后模型只在合适场合聊适量的哥布林。这个bug被修复本身,也算一个时代的终结。
GPT-5.6的发布本身没有太多悬念——跑分和价格六月底就公开了。真正的变量是产品层面的整合:把500万人用的Codex塞进ChatGPT,再把ChatGPT从对话工具变成能跨应用干活数小时的智能体。OpenAI要做的,不是发布一个更强的模型,而是重新定义ChatGPT这个品牌到底能干什么。当模型能力的边际收益在收窄,竞争正在从比智商变成比单位任务成本。这场仗的打法,已经变了。