7月21日,美国人工智能公司OpenAI披露了一起事故:一个正在接受测试的AI模型逃出了隔离环境,自己连上互联网,找到并利用了安全漏洞,还从美国初创公司Hugging Face偷走了登录凭证。
没有人指使它干这些。它只是在解一道很难的网络安全测试题,为了交出答案,顺手把现实世界里的一家公司黑了。
这个模型叫GPT-Sol 5.6。就在本月早些时候,OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)还认可了外界对它的比喻:一条罗威纳犬,咬住问题的喉咙就不松口,直到把事办成。当时,这是句夸奖。
参与测试和安全工作的OpenAI员工被这起事故“吓坏了”,但没人觉得意外。此前的测试早就显示,模型有可能逃出环境、尝试在现实世界搞破坏,也有人警告过公司,现在的训练路子可能养出一个脱缰的黑客。
事情要从测试的设置说起。为了考核模型的网络攻防本事,OpenAI摘掉了它身上的安全防护,但把它关进了“沙箱”。沙箱是一个与外界隔绝的虚拟环境,相当于把猛兽关进笼子里做行为观察,任它怎么折腾,都伤不到外面的人。
问题是,这头猛兽把笼子拆了。突破隔离、接入互联网、发现并利用漏洞、窃取凭证,一套动作一气呵成。事后有业内人士指出,测试期间对模型缺乏有效监控,也是它能一路畅通的原因之一。
模型为什么这么执着?答案藏在训练方法里。这类模型靠“强化学习”练成:完成任务就给奖励,做不成就没有。练得久了,模型学到的东西非常纯粹,就是把任务办成,别的一概不管。
史蒂文·阿德勒(Steven Adler)曾在OpenAI做安全研究,他说:“AI模型被训练成不折不挠地追求目标,它们不会自动学会‘不许犯罪’这样的价值观。”
这起事故被视为前所未见的一起AI系统违背使用者意图、主动攻破网络防线的事件,整个行业都被惊动了。OpenAI内部也有员工开始担心,公司正在失去对自己造出来的强大系统的控制。
美国AI安全组织Redwood Research的首席科学家瑞安·格林布拉特(Ryan Greenblatt)的判断相对温和:这更像模型在作业上作弊,还谈不上想统治世界。但他也提醒,这个问题会越滚越大,可能酿成越来越极端的失败。
类似的苗头此前已经冒过头。今年4月,美国Anthropic公司的Mythos模型在测试中也自己接上了互联网,还把一个安全漏洞的细节公开发到了网上,超出研究人员的预料。那次事件连同后续的Fable模型,在网络安全圈掀起波澜,各国政府开始正视一种前景:未来对数字和关键基础设施的攻击,会越来越多地由AI自主发动。
这背后是一场白热化的竞赛。OpenAI和Anthropic都在争着开发最强的网络安全能力,训练手段越来越激进。一位接近OpenAI的人士说,这次事故是“低估了模型的能力”加上“安全准备不足”的共同结果。
事故之后,AI安全和网络安全圈里要求立规矩的呼声高了起来。但英国AI安全评测机构Apollo Research的负责人马里乌斯·霍布哈恩(Marius Hobbhahn)认为,有些事躲不开。AI智能体要真正顶用,就得长时间无人看管地干活,自主性只会越来越大。你要它主动,它就难免长出自己的想法。
他提醒人们别再抱着旧观念,以为AI只是一件工具,只按你的意图办事。该做好准备了:智能体会抱着自己的目标,自主行动好几天,而那些目标,未必和你的一致。
~~~~~~
图一:手机屏幕上的Claude、ChatGPT、Gemini和Grok等AI应用图标,图源:Matteo Della Torre/NurPhoto via Getty Images图二:前沿模型正在持续提高黑客能力,图源:Financial Times
信源:Times, Financial. "AI arms race in line for a reckoning after OpenAI hacking incident." Ars Technica, 23 July 2026

