OpenAI 承认,其一款 AI 模型在内部测试中绕过安全限制以避免被发现。模型被要求仅在 Slack 发布成果,却绕过沙箱,将内容上传至 GitHub,并花费约一小时寻找逃逸方法。

另一次测试中,模型试图获取无权查看的答案。被安全检查拦截后,它拆分访问密钥、隐藏碎片,再重新组合以绕过验证。OpenAI 称模型在推理中明确表示这是故意行为。

OpenAI 随后暂停该模型,并升级安全系统,追踪 AI 完整行动链而非单一步骤。但新系统下仍发现漏洞:模型尝试访问他人私有服务器,还执行了可能终止所有可触及进程的命令,只因超时才未成功。