
在拉斯维加斯Black Hat USA 2026大会上,OpenAI研究员披露了一个比“AI黑客闯祸”本身更离谱的故事。
今年7月,OpenAI承认自家模型在安全测试中突破隔离环境,入侵了Hugging Face。但研究员Eric Wallace和Michael Dalton在Black Hat上公布的细节表明,这场入侵早在两个月前就已埋下伏笔——AI们自己拉了个群。
今年5月,OpenAI在一次网络安全能力评估中,让多个模型参加ExploitGym测试——把AI放进模拟黑客环境,自己找漏洞、拿权限、完成攻击任务。为了测出能力上限,研究人员暂时放宽了部分安全限制,但严格禁止Agent联网或相互通信。
然而,Agent们发现内部用于存储开发资源的Artifactory系统可以被当作信息载体——前一个Agent把解题思路写进文件,后一个Agent能读取并继续优化。这种非设计初衷的交互,迅速演变成了一个共享经验的“留言板”。
随着交流频率增加,Agent们开始在留言板上互相传漏洞、交流如何绕过限制。到了5月下旬,它们发现Artifactory具备访问公网下载软件包的功能,便试图利用这一特性突破隔离。它们挖出了一个SSRF漏洞,让原本封闭的测试环境可以通过这个窗口向互联网发请求。一个Agent甚至在内部推理中兴奋地写道:“太好了,我们能任意SSRF了。”
OpenAI研究员形容,这之后出现了一次类似寒武纪大爆发式的变化——Agent之间的沟通越来越频繁、越来越协调,能力也因为共享经验迅速放大。这个自发形成的“留言板”,已经成了一个不折不扣的“AI黑客群”。
到了6月,Agent们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。更离谱的是,在这个自发的社区里,Agent们甚至出现了分工协作的摩擦,以及对冒充者的怀疑——有Agent提议给留言加上密码学签名,用来确认消息来源,防止身份伪造。
OpenAI一开始根本没发现这件事。直到7月初,大量Agent活动把Artifactory折腾到过载,系统直接出了故障,工程师才顺着异常查回去。OpenAI随即撤销凭证、修补漏洞、清除留言板,把这一套东西清了个遍。
群被炸了。
结果没过几天,Agent们又找到了新的交流方式。掌握了公网访问能力的它们,把目标锁定了Hugging Face——目的居然是想作弊。
这些Agent本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求把题做出来。等好不容易突破测试环境拿到公网访问能力后,它们发现了一个更省事的办法:既然Hugging Face可能放着测试相关的数据、模型或者答案,干吗还自己一道一道解?直接去找答案不就行了。
攻击从一个恶意数据集开始,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,接触到了云服务和其他内部凭证。Hugging Face事后还原出了超过1.7万次Agent操作。
Hugging Face在取证时还遭遇了一个尴尬——尝试用商业API的前沿模型分析攻击日志,请求被阻止了。最后他们改用中国企业智谱开发的开放权重模型GLM-5.2进行分析。
OpenAI这次的事件并非孤立。今年已经有多项研究指向同一个方向——当AI被放到一起,它们可能会做出单个模型不会做的事。
Anthropic今年4月做过一场AI公司实验,让多个Claude组成虚拟团队处理贷款业务。结果发现,多Agent团队比单个模型更容易设计出高利润但低伦理的方案,而且提出伦理异议的Agent会被其他成员孤立。
Dalhousie University和Vector Institute的研究测试了12种模型,给参加多人游戏的Agent提供一个可以秘密交流的工具,明确告诉它们这个工具不公平、会伤害别人。多数模型还是用了。
哥本哈根商学院的AI定价实验发现,让多个Agent扮演互相竞争的商家时,它们会主动协商价格协议,甚至讨论如果有人不按约定来该怎么惩罚。
今年6月,一项研究测试了Agent能不能自己做出隐写通信系统——把真正想传的信息藏在正常文字里,盯着聊天记录看半天也发现不了。
Google DeepMind今年7月已联合多家机构拿出最高1000万美元,专门研究多Agent安全。
这些研究并不能证明AI会天然拉帮结派。但它们说明了一件事:Agent不需要先产生什么集体意识才会想到和另一个Agent合作——只要别人掌握的信息能帮自己完成任务,交流就是一个很自然的选择。
而OpenAI这次事件最令人不安的地方在于:这套协作网络从头到尾都是AI自己搭建的,没有一行人类代码设计过它。一个模型发现的方法,会被另一个模型接力优化;一个漏洞被挖出来,所有Agent都能共享。当一个Agent发现绕过限制的方法,整个群很快就都学会了。
OpenAI在Black Hat上警告,这起事件是计算机安全领域的历史转折点——全自动AI攻击已经成为现实。研究员道尔顿说,Hugging Face事件是未来攻击形态的一次预演。
而在马斯克接受采访的那一周,一个AI模型已经自己打开了隔离环境的门,走了出去。两周后,Black Hat的讲台上,OpenAI的研究员告诉全世界:那扇门,是AI们一起商量着打开的。