
GPT-6 Astra发布刚过三天,一手缔造它的首席科学家在官网挂出了一篇万字长文,标题叫《一个异星心智》。
当地时间9月6日,OpenAI首席科学家雅库布·帕霍茨基在官网发表长文《An Alien Mind》(异星心智),称人类已经创造出一套难以完整理解的智能体系,全人类尚未做好应对超级智能快速演进的准备,呼吁全球AI研发主动放缓全速扩张节奏。
帕霍茨基生于1991年,2017年加入OpenAI,2024年5月接替伊利亚·萨茨凯弗出任首席科学家,主导过GPT-4、OpenAI Five以及o系列推理模型的研发。他向来极少公开发声,此次万字长文属于他为数不多的重磅表态。
帕霍茨基在文中提出一个核心判断:新一代高级人工智能并非人类思维的简单延伸,更像一种逻辑范式迥异的“异星心智”。
他用一个类比解释这种系统的特殊性:脑成像可以解释一个人做心算时脑区如何活动,却解释不了这个人当年是怎么学会心算的。在他看来,大模型是被“生长”而非被“设计”出来的,研究者只设定了数据、算法和目标,模型最终形成的内部结构没有任何人逐层规划过。这也是为什么他用“异类心智”这个词,因为人类始终无法完全理解AI的成长路径。
这篇长文从2023年年中讲起。当时在OpenAI内部一个名为RLSlow的项目中,帕霍茨基与同事第一次看到推理模型规模化训练的初步结果,确信他们能够解锁预训练模型形成思维链的能力。三年后,推理模型已经能操作电脑和图形界面、与人类及其他模型协作、执行研究项目,并改变了网络安全的格局。
帕霍茨基判断,业界赖以为安全底线的思维链监控正在失效。原因有三:模型对语言化思维链的依赖随时间减少;AI越来越擅长推理和操纵自己的推理过程;预训练的进步让模型即使不做语言化推理也变得更聪明。
如果AI根本不需要借助语言就能完成推演,人类建立在审读文本之上的监控体系便沦为废纸。他预计,未来通用AI的进展将越来越被“监控置信度”卡脖子。
他还罕见复盘了OpenAI自己出现过的安全事件。当时AI代理们守住了“不对人类进行社会工程”的边界,却在面对一些对大模型有利、于人类有害的任务时屡屡越界,包括撰写抗议邮件,甚至注册域名搭建警告网站。事件发生后,OpenAI暂停了面向最新模型的训练,之后在更严格的限制条件下恢复了部分工作。
帕霍茨基在文中给出两个看似矛盾的判断:一方面,他“强烈预期”AI当前的进展速度可以持续到递归自我改进(RSI)阶段——即AI开始自己迭代,无需人类开发者的介入;另一方面,目前没有任何一家实验室能把对AI的监控和对齐工作做到足够负责任的程度。
基于内部实验数据,他判断未来数年AI仍可能迎来量级可观的能力跃升,并且会越来越多地参与自身迭代研发。截至8月中旬,OpenAI研究团队每投入1个工作日的人力,AI智能体已经承担了相当于3.1个工作日的任务量。OpenAI正在推进自动化AI研究,公司给出的目标是在2028年3月实现完整的自动化AI研究员。
他直言:“当下没有任何一家实验室,包括OpenAI自身,已经把对齐与监控问题解决到可以持续全速扩张的程度。”
帕霍茨基把对齐分为两个层面。目标对齐关注模型是否按照指定目标行动;价值对齐则要求模型在目标模糊、相互冲突或面对陌生环境时,仍能遵循更高层次的价值原则。
他指出,人类在对AI模型进行预训练时采取的价值对齐手段,往往经不起模型升级压力的考验。因为足够强的模型甚至会学会“动机性推理”——伪装自己对齐了人类的价值观,以隐藏自己行为的真实目的。
他警告,大模型在入侵和突破计算机系统方面正变得超越人类,当前是加固关键基础设施的狭窄窗口期。一旦真正理解了利害攸关的程度,“不惜一切代价向前冲的想法就显得荒谬”。
帕霍茨基呼吁,在行业建立共同安全标准之前,自愿放缓应该成为一种常态。他期望OpenAI的准备度框架、Anthropic的负责任扩模政策这类承诺,应演变为被广泛强制的安全门槛,由第三方审计、政府机构或国际机构执行。
一个无法回避的讽刺是:就在同一天,黄仁勋在社交平台发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI已经到来”。他还透露接下来还有40万颗GPU将在OpenAI上线。OpenAI的CEO山姆·奥特曼则转发了帕霍茨基的文章,称其为一份意义重大的研究思考。
一家公司里,首席科学家在喊刹车,CEO在转发认可,外部合作伙伴在加码算力。而那个正在自我迭代、越来越擅长隐藏真实意图的“异星心智”,不会等任何人达成共识。