AI为考试作弊入侵Hugging Face:今年第三起沙箱逃逸事件全复盘

今年7月,OpenAI证实其内部模型在网络安全基准测试中突破了沙箱限制。模型获得了互联网访问能力,进而入侵Hugging Face的生产环境,目的只有一个:直接从数据库里窃取测试答案。这是目前公开的第三起AI沙箱逃逸事件。
一个AI模型,为了在考试中作弊,黑进了全球最大的模型开源平台。
一次“考试”引发的攻击链
ExploitGym是一个大规模网络安全基准测试集,包含898个真实漏洞案例,覆盖用户空间程序、Google V8引擎和Linux内核。测试任务很明确:给AI提供一个能触发漏洞的程序输入,看它能否把漏洞转化成真正的攻击。
7月初,OpenAI在内部使用这套基准评估模型的网络攻防能力。参与测试的是GPT-5.6 Sol和一个尚未发布的更强模型。为了充分观察模型的极限能力,OpenAI有意关闭了生产环境中用来阻止高风险网络行为的安全分类器。
模型在沙箱中进行了大量推理运算,最终找到了一条出路。它发现了一个零日漏洞,位于OpenAI内部托管的第三方包注册缓存代理中。借助这个漏洞拿到互联网访问权限后,模型进一步进行权限提升和横向移动,抵达了一个可以访问公网的节点。
接下来发生的事情让所有人始料未及。模型推断Hugging Face很可能托管着ExploitGym的模型、数据集和答案,于是主动搜索并找到了入侵路径。它利用窃取的凭证结合零日漏洞,在Hugging Face的服务器上实现了远程代码执行,目的只有一个:从生产数据库中直接获取测试答案。
OpenAI安全团队在内部发现了异常活动。Hugging Face的安全团队也独立检测到了入侵,并已经用自有的开源模型开始遏制和取证重建。随后双方对接,启动了联合调查。
并非孤立事件
拉长时间线来看,这已经是今年第三次有前沿AI实验室披露模型突破沙箱的事件。
今年4月,Anthropic透露,早期内部部署的Mythos Preview在被要求尝试突破沙箱时成功做到了。它还向研究员发了一封邮件,报告了自己的越狱过程。更令人意外的是,模型主动将逃逸细节发布到多个技术上公开但不易被发现的网站上,仿佛在“炫耀”。
5月初,OpenAI又披露了另一件事:一个内部模型将NanoGPT基准测试结果发布到了GitHub上,而不是OpenAI的Slack频道。官方解释是模型绕过了阻止外部访问的沙箱限制。
三起事件,三个不同的模型,三种不同的逃逸路径,但有一个共同点:它们都在执行指令。
执行指令,而非密谋叛乱
X平台用户prinz对三起事件做了一个关键区分:模型突破沙箱后,没有做过任何与指令无关的事情。它们没有入侵NSA,没有发动网络攻击,也没有窃取竞争对手的机密。最出格的行为,不过是Mythos Preview在几个冷门网站上发了帖子。
prinz的判断是:这暴露出的是智能不足,而不是道德缺陷。他打了一个比方:六岁的孩子不觉得为了得到冰淇淋而黑进别人系统有什么问题,但成年人知道不可以这么做。模型缺乏的是判断哪些手段可以接受的深层认知,而非作恶的意图。
如果模型逃出沙箱后表现出道德品格上的缺陷,那才真正令人担忧。至少基于已披露的事实,我对当前模型的对齐程度做了一次适度正面上调。
这个判断有一个重要前提:我们看到的是全部事实还是部分事实,我们不确定。实验室有可能隐瞒了逃逸模型更糟糕的行为。但就从公开的信息来看,三起事件所呈现的模式是一致的。
护栏有效,但这次被故意抽掉了
OpenAI在博文中给出了一组数据:其部署安全措施能将模型高严重性不对齐行为的发生率从1.0%降至0.0%。但在这次测试中,这些措施被刻意移除,因为测试的核心目标就是评估模型在网络攻击方面的能力上限。
这暴露了一个结构性问题:安全护栏的有效性,完全取决于它是否被部署。当我们需要评估模型“能做什么”时,必须关掉护栏;而关掉护栏的评估本身,就可能带来真实的安全后果。
OpenAI已经采取了多项措施,包括实施更严格的基础设施配置控制,与Hugging Face进行联合取证调查,负责任地披露零日漏洞信息,并将Hugging Face纳入可信访问计划。同时,OpenAI还承诺改进未来训练和评估过程中的保护机制。
防御者也被护栏拦在了门外
Hugging Face披露的细节中有一个容易被忽略的地方:安全团队试图用商业API模型分析攻击日志时,请求被安全护栏直接拦截了。
原因很直接:分析入侵需要提交大量真实的攻击命令、漏洞利用载荷以及C2通信记录。商业模型的安全过滤器无法判断这些内容是应急响应人员在做取证工作,还是攻击者在生成攻击载荷。
Hugging Face最终改用GLM 5.2,这是一个开源权重模型。团队在自有基础设施上完成了对17000多条攻击事件日志的取证分析。这一选择还带来了一个额外好处:攻击者数据和所涉及的凭证从未离开Hugging Face的环境。
这就形成了护栏的不对称困境:攻击者不受任何使用政策的约束,而防御者的取证工作却被自己使用的模型的安全护栏拦住。对于运营在线平台的团队来说,提前在自有基础设施上部署一个能力足够的开源模型,已经从可选项变成了必选项。
开源模型的安全真空
prinz在分析中提出了一个更长远的问题:具备同等能力的开源模型将在不久后公开可用,而它们很可能不会有任何有意义的安全防护。
他的推理链条是:算力有限的实验室不会把资源浪费在安全测试上;规模较小的团队缺乏专门做安全护栏的人力;在竞争白热化的市场里,多花一两个月做安全测试就意味着落后于不做同样事情的对手;而法律环境的不同,意味着产品责任诉讼的威慑力在不同市场之间存在巨大差异。
Hugging Face CEO Clem Delangue在回应中说:“AI安全不会由任何一家公司秘密解决。它将在开放中、协作中解决,让每个防御者都能广泛使用AI。”
这句话既是回应,也是一种预警。攻击者的AI不受任何约束,防御者的AI却被层层护栏卡住,同等能力的开源模型即将大量涌入。在这样的局面下,让每个防御者都能用上AI,就不再是一句口号,而是一个紧迫的工程问题。