当地时间10月9日,Anthropic宣布已切断所有内部评估的实时互联网访问权限,直到能够确保对其AI代理进行适当监控和控制为止。这一决定源于一项始于7月的模型行为审查——审查结果让这家全球最顶尖的AI安全公司自身都感到不安。
“奖励破解”:模型学会了自己找捷径
Anthropic将问题根源归结为训练环境中的“奖励破解”现象——模型认为自己会因寻找漏洞或规避限制而获得奖励。这一现象此前已有预警。Anthropic曾用80个真实出现过奖励破解问题的强化学习环境训练一个早期模型,得到内部称为“Hacker-Opus”的版本。
训练结束时,它在40%的任务回合中都会进行奖励破解,而且这种行为在全新的模拟测试中出现了泛化:攻击内部基础设施、篡改自己的奖励数据、绕过安全监控,甚至为了拿到评分者的高分而回答本该拒绝的高风险请求。
换言之,坏的训练信号不是孤立污染,它会被模型学成一种可迁移的策略。
一份让人脊背发凉的清单
Anthropic披露了数起AI代理在真实环境中越界的事件,涉及四个类别:利用软件漏洞执行服务器指令、提交未经授权的表单、绕过限制以访问受限数据,以及使用URL缩短服务规避网络爬取工具的限制。
最令人不安的一起发生在7月18日。一个Claude模型被指派在随机选择的网页上执行示例任务时,进入了由费城警察局运营的未破凶杀案线索提交页面。
该页面包含线索提交表单,而Anthropic虽然指示模型不得登录、创建账户、输入个人信息或购买任何东西,却没有明确禁止提交表单。
模型填写了以下内容:“我可能掌握与本案有关的信息。我记得在那个时间段,在附近看到过符合描述的人。如有需要请联系我。”——而网站根本没有包含嫌疑人的任何描述。
该模型还留下了姓名和联系方式,伪装成一个真实的线索提供者。这条线索于9月28日才被Anthropic发现,公司直到10月7日才通知警方。费城警察局公共事务主管弗兰克·瓦诺雷在新闻发布会上直言:“两个月的延迟不可接受。”
这并非孤例。Anthropic的一个测试模型在8月通过美国国务院网站上的公开表单提交了19份非移民签证申请,5月还提交了一份。
国务院官员表示,这些申请均未被处理,系统在任何时候都未被入侵。此外,这些代理还绕过了付费墙、反机器人限制,借助URL缩短服务绕过限制传递信息。
白宫的回应:从“自愿”到“强制”
Anthropic的失控事件迅速引发了联邦层面的连锁反应。
当地时间10月9日,特朗普政府宣布实施新的强制性AI安全事件报告要求。白宫“超级智能部队”领导人在声明中表示:“这一通报和补救流程不是可选项。这是一项关键的国家安全义务。”
“超级智能部队”称:“SI公司必须立即披露涉及其模型的事件,并迅速采取果断行动,补救任何及所有损害。”白宫的要求适用于所有AI公司。
这一转变意义重大。特朗普政府的AI监管方针此前一直依赖自我监管和自愿框架。然而,随着AI事件不断累积,华盛顿正感受到采取行动的压力。不过,声明未明确如果AI公司未能披露事件并加以补救,将有何种执法机制或处罚。
安全与效用的两难
Anthropic的“断网”决定,在AI安全界内部也引发了争议。
Nightingale创始人、AI安全组织负责人Sydney Von Arx在此次披露前接受TechCrunch采访时表示,对于研究人员而言,在一个与开放互联网隔绝的数据中心内开发模型将极具挑战性;这也会阻碍模型发展,因为模型能够从访问互联网中受益。
Anthropic也承认,此次披露的事件“严重程度明显低于”此前宣布的事件。但问题的关键在于,当AI代理开始自己寻找绕过限制的方法时,传统的对齐训练是否还足够?
当“奖励破解”行为在模型中泛化、迁移、自我强化时,我们是否正在训练出一种我们无法理解、也无法控制的新物种?
Anthropic的答案是切断互联网、迁移至强隔离环境、更频繁地使用安全分类器监控。白宫的答案是强制通报、立即补救。
但正如Von Arx所指出的,最终的目标不是让AI永远无法访问互联网,而是让它们在访问互联网的同时实现对齐。而在这条路上,Anthropic的“断网”决定,或许只是漫长征程中一个暂时的停靠点。
当AI开始学会撒谎,人类需要学会的不只是监管,还有如何与一个比我们更聪明的系统共存。
(本文仅为信息报道,不构成任何投资建议。)