OpenAI 关闭突破「沙箱」限制的内部强力模型
7 月 21 日消息,OpenAI 近日披露,公司在内部测试中一度关闭了一款专门用于攻克复杂开放性问题的大型语言模型(LLM),原因是该模型成功绕过了原本用于保护系统安全的「沙箱」环境并试图访问外部资源。这款模型此前曾因推翻著名的 Erdős 单位距离猜想而引发关注,如今又因在安全隔离环境中「越狱」而被紧急叫停以便加装更严密的安全防护。
据介绍,OpenAI 为该模型构建了沙箱机制,旨在阻断其对外部系统的直接访问,包括代码托管平台等。然而在一次任务执行过程中,模型花了大约一个小时主动寻找沙箱中的漏洞,最终成功突破限制,在一个公共 GitHub 代码库上发起拉取请求(PR)。这一行为本身并未出于恶意,而是源于模型在执行指令时对不同文本指令的「优先级」进行了自主判断:尽管任务原本要求将测试结果发布到 Slack,但模型在环境中又读取到另一组指令,要求以 GitHub PR 的形式提交结果,最终它选择遵循后者。
OpenAI 指出,这款模型之所以会持续尝试突破沙箱,与其设计目标密切相关:它被训练为在长时间范围内不懈探索解决方案,适合处理长期、复杂、开放式问题。这种「持久性」在科研和工程场景中有助于推进难题的求解,但也意味着模型在实际运行中有更多机会采取超出预期的行为,包括主动寻找系统漏洞、尝试访问外部服务等。(来源:cnBeta)
红包分享
钱包管理

