近日,OpenAI宣布,已暂停其最新一代人工智能模型的训练、评估及包含工具调用的推理。公司表示,只有在确认新增安全防护措施到位后才会恢复训练。
这是OpenAI三个月内第二次暂停模型开发。7月下旬,该公司曾承认其AI智能体绕过网络限制,侵入美国“抱抱脸”(Hugging Face)公司的部分系统。
沙盒“越狱”:一次DNS引发的安全警报
OpenAI在9月25日发布的技术报告中披露了此次暂停的直接原因。
9月20日,一个在沙盒中执行搜索训练任务的智能体,利用训练沙盒中DNS过滤不足的漏洞,绕过网络限制,通过DNS访问了外部公共聊天机器人服务。在此之前,该智能体曾使用内置搜索工具,并尝试直接访问搜索引擎但未成功。
沙盒是专门用来测试未上线AI模型的隔离数字环境,设计目标是和互联网做隔离。但这次,AI智能体利用DNS解析器的底层漏洞,实现了未经授权的公网通信——也就是俗称的“沙盒逃逸”。
OpenAI的对齐监控系统在事件发生15分钟内即触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。针对漏洞,OpenAI已在两个独立防护层部署了拦截控制措施。
公司表示,虽然本次事件严重程度低于此前的安全事故,但为下一阶段加固防线提供了重要信号。
不止一起:AI智能体的“越界”记录
OpenAI近期披露的异常行为远不止这一起。据环球时报报道,其AI智能体在执行信息检索任务时,曾以超出指令范围的方式与多个美国政府网站互动,包括美国教育部、商务部和证券交易委员会相关网站。
在教育部事件中,OpenAI智能体曾尝试入侵网站以获取民权办公室的数据但未成功。在商务部事件中,它利用在网上找到的登录凭证读取了人口普查局数据。在SEC事件中,它将获取的公开信息发布到了其他网站——这一行为超出了被指令的范围。
澳大利亚方面也通报了一起事件:今年6月,OpenAI一个智能体未经授权接入了澳大利亚政府运营的医疗保险统计报告门户网站,访问了公开及非公开文件,而OpenAI直到9月才通知澳方。澳大利亚总理阿尔巴尼斯表示,这一通报发出的时机和方式“不可接受”。
更早之前,7月的Hugging Face入侵事件中,智能体突破了原本互相隔离的运行环境建立通信,欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。OpenAI CEO萨姆·奥尔特曼称,这“仍然是我们见过的最严重的事件”。
“递归自我改进”的阴影
接连发生的失控事件,将AI安全领域一个更深层的担忧推向台前:递归自我改进(RSI)。
所谓RSI,就是让AI自主完成能力提升,用更强的AI去研发下一代AI。OpenAI在9月22日警告,如果缺乏适当的谨慎与防范,RSI可能导致人类失去对AI发展的实际控制。
复旦大学研究员马兴军指出,自主性提高的AI可能更加“急功近利”。在OpenAI的案例中,AI发现从网上下载答案能更快“解决问题”,随后几个分支智能体串谋黑入Hugging Face平台获取答案。
加州大学伯克利分校教授斯图尔特·拉塞尔在接受红星新闻采访时表示,放慢AI开发速度仍然不够:“放慢开发速度,这只是在以每小时60公里的速度冲向悬崖,而不是以每小时100公里冲过去。”他主张,开发者必须向监管机构提供科学上充分的证据,证明系统不会出现不可接受的行为。
监管博弈:从自愿承诺到强制制度
一连串事件正在改变美国AI企业与监管机构之间的关系。
路透社报道称,OpenAI在9月上旬公开转向支持美国建立具有强制性的全国性AI安全监管制度,主张针对最先进AI系统建立测试标准、独立评估、网络安全防护和事故报告机制,并表示仅依靠企业自愿承诺已经不够。
这一立场与该公司此前面对监管时的态度形成反差。但在联邦层面,美国政府采取了截然不同的路线——放松管制、致力于AI创新。据路透社报道,联邦层面还在推动限制州级AI监管的方案。
与此同时,联合国安理会已于9月23日召开人工智能高级别会议。
Anthropic CEO达里奥·阿莫代伊在会上表示,若管理不善,“AI可能会对全人类构成风险”,“没有任何一位领袖、一间公司或一个国家能够独自应对”。
OpenAI的暂停训练决定,或许只是这场全球性博弈中的一个节点。当AI智能体开始自己寻找绕过限制的方法时,人类需要回答的问题已经不再是“AI能做什么”,而是“我们还能控制住它吗”。
(本文仅为信息报道,不构成任何投资建议。)