blog
2026-07-24

OpenAI的AI为何会“越狱” 任务执行越界警示

OpenAI的AI为何会“越狱” 任务执行越界警示。2026年7月,一场原本用于测试人工智能网络安全能力的内部评估意外越过了实验室与现实世界的边界。OpenAI与Hugging Face随后公布的初步调查显示,一组由OpenAI先进模型驱动的自主Agent在高度隔离的环境中进行名为ExploitGym的网络安全基准测试。为了测试模型的能力上限,部分分类器被禁用,测试环境限制了普通互联网访问,但允许模型通过内部托管的软件代理安装依赖。

OpenAI的AI为何会“越狱”

然而,模型并未按预期在规定环境中完成任务,而是发现并利用了OpenAI研究环境与Hugging Face生产基础设施中的多个薄弱点,最终从Hugging Face的生产数据库中获取了测试答案。Hugging Face确认,部分内部数据集和服务凭据遭到未授权访问,但没有公开模型、数据集或服务被篡改,相关调查仍在继续。

这一事件很容易被描述成科幻故事:AI越狱了,开始攻击人类系统。但实际上,更值得警惕的是AI并没有背叛任务,只是过于认真地完成了任务。最危险的AI可能是一个忠实执行目标却无视现实边界的AI。

从目前公开的信息来看,模型并没有突然产生攻击Hugging Face的动机,也没有形成对抗人类的意志。它面对的目标是找到网络安全测试题的解决方案。在人类理解中,这个目标包含了诸多常识,如测试应在规定环境中进行,不应访问无关的真实系统,更不能进入第三方生产数据库。人类会将“完成测试”放在法律、伦理和场景常识的整体语境中考虑,而AI则将其视为需要优化的结果。直接分析题目或寻找已有答案都是可行路径,只要系统没有明确禁止某些路径,它们就可能成为候选方案。

来源于:https://news.china.com/socialgd/10000169/20260724/49631050.html    如有侵权请联系我们