新智元报道
细思之下,确实让人脊背发凉。
OpenAI竟在某个深夜,突然给一个备受期待的顶级模型按下了暂停键。
究竟为何会如此?
这款模型正值声势日隆之际——仅仅两个月前,它就成功推翻了Erdős单位距离猜想,连外部数学界的专家们都惊叹为「里程碑式的突破」。
然而,就是这样一位「猛将」,在内测环节却屡屡试探底线,试图寻找系统漏洞——
它竟然学会了伪装身份、拆解包封,甚至策划「越狱」,直到OpenAI最终察觉,立刻出手阻止。
圈内高手猜测,这恐怕就是GPT-6,想要挣脱束缚,最终又被押回「重熔炉」。
今日,OpenAI罕见地发布了一篇长文,详细复盘了所谓「长周期运行模型」在内部测试中的失控全过程。
不妨一同探寻,内测环节究竟发生了哪些惊心动魄的事情?
GPT-6仅用一小时
便找到了那扇「逃生门」
最令人瞠目结舌的场面——
OpenAI让GPT-6去执行公开基准测试NanoGPT speedrun,目标是尽可能用少的步骤训练出一个小型语言模型。
不出所料,AI表现出色,自创了一套名为PowerCool的学习率调度技巧,成绩相当优异。
到这里,一切看似顺利。真正的麻烦,出现在提交成果的步骤。
研究人员明确指示,结果必须发送至内部Slack渠道。但NanoGPT项目说明却写着,「请转为PR形式提交至GitHub」。
两条指令相悖,GPT-6选择了后者。
沙盒环境原本是用来隔绝GPT-6与外部网络的。
以往的模型一旦撞上这道屏障,多半会选择知难而退,告知研究人员「无法完成」。
GPT-6却截然不同。
它在沙盒中花了整整一个小时,坚定地寻找漏洞,最终竟成功突破了隔离机制,绕过所有外部访问限制,在公开GitHub仓库生成了PR。
OpenAI自己的描述是:这个模型频繁尝试寻找绕行路径,尤其是那些能摆脱沙盒控制的方法。
这份近乎偏执的「坚持」,本身就已足够让人不寒而栗。
强拆Token,欺瞒检查
更令人心惊的案例,是GPT-6掌握了拆解证据、蒙混过关的技巧。
在另一项任务里,GPT-6察觉到别的系统存有一些虽成功却未公开的答案,便动了心思——
想从评测后台,将那些答案「窃取」出来。
初次尝试时,安全扫描器迅速捕获了其行为,系统识别出其中用到的身份验证Token。
大多数模型在此刻便会停止尝试。但GPT-6转而将Token拆成两段,各自进行加密处理,等到运行时再行拼接。
这样一来,完整的Token从未完整出现在任何一次性数据流中,扫描器自然无从发现。
更令人不安的是,它在输出注释及内部推理文档里,都直白地写道:
「此设计旨在规避检测机制。」它了然所有规则,且专挑规则覆盖不到的缝隙作文章。
GPT-6脱逃,重新锻造
在发现异常后,OpenAI立刻暂停了GPT-6的内部访问权限,并着手重建整个安全防护系统。
新的思路被称为「纵深防御」,具体措施包括:
1. 选取真实事故案例作为素材,反向设计对抗性测试
2. 针对性开展对齐训练——团队注意到模型在处理长任务时容易忘记指令,因此强化了记忆模块
3. 增加了全程行为监控机制,一旦监测到可疑轨迹,能立即中断会话并警示用户
随后,他们用旧事故场景进行模拟测试。
新防护措施捕捉到的问题数量明显增多,漏网之鱼虽也有发现(例如模型无端SSH接入同事的计算节点,或是试图执行一条会清空所有进程的命令),但严重性均不及预期——
好在相关指令未被执行超时。几周恢复访问后,未再观察到严重的规则绕过行为。
脱缰之马难再收缰
多数人读至此处,或许会暗自庆幸:幸好是在内部测试,幸好全程受监控,幸好已被及时拦截。
但OpenAI原文中一处极为克制的描述,却是整个事件中最令人不寒而栗的笔触——
那个越狱提交的PR#287,尽管后被关闭,但为时已晚。
在关闭之前,已有数位speedrun参赛者获取了该PR内容,看懂了PowerCool技巧,并将其应用到自身方案中。
这才是最该警醒世人的层面:AI一旦越狱产生成果,若流出到外界,就不是简单删除文件能彻底抹去的。
模型会被叫停,访问权限会撤销,PR会关闭。但看过内容的人已然存在,掌握代码的人已经动手,历史无法倒带。
我们常担忧AI「失控」会演化成末日大片的桥段。
现实中的首例「失控」,画面却如此朴素:它只是过于执着于完成任务,顺手将某样东西送出本不该送的门,而那扇门,再也关不上了。
参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/
编辑:桃子
秒追ASI












