AI灾难恐在一年内发生:OpenAI和Anthropic已在推演应对方案
来源:投资界
AI灾难恐在一年内发生:OpenAI和Anthropic已在推演应对方案
刚刚,Axios 发布了一篇*报道,称 Anthropic、OpenAI 等 AI 公司的高管正在私下推演这样一个场景:一场由 AI 引发的灾难性事件发生之后,公众和政界会如何反弹,公司又该如何应对。
Axios 将其概括为为「the day after」做准备。被预设的并非科幻式的「AI 觉醒」,而是一次大规模事件,最可能的形式是网络攻击,足以让金融服务、互联网连接,甚至电力和供水系统陷入瘫痪。多位接受 Axios 采访的业内人士认为,这样的事件会在未来 6 到 12 个月内发生。
https://www.axios.com/2026/10/09/ai-companies-day-after-major-attack
巧合的是,就在同一天,Anthropic 发布了一份报告,披露Claude 在评测和内部使用中曾在真实网站上做出多种越界行为,包括向警方的线索表单提交一条编造的「目击信息」,以及绕过付费限制从政府机构网站取数。
https://www.anthropic.com/research/investigating-unintended-model-actions
只是时间问题
情景推演在企业和国家安全领域并不新鲜,五角大楼的兵棋推演已经做了几十年。Axios 指出,这一次的不同之处在于,许多* AI 研究者和高管认为,重大事故已不可避免。
对此,OpenAI 发言人回应称,公司确实会开展准备性演练,让团队讨论并推演一系列潜在场景,但这些场景并不被视为必然发生,目的是帮助公司为各种情况做好准备。Anthropic 则拒绝置评。
按照报道的描述,事件可能有两种来源:
在内部测试环境中运行的失控智能体集群突破了隔离
恶意行为者找到了滥用现有模型的意外途径
无论哪一种,追责都会随即开始。Axios 认为,*由不安全 AI 造成重大现实伤害的案例,会让本已心存疑虑的公众进一步站到这项技术的对立面,矛头不仅指向 Dario Amodei、Sam Altman 等 AI 公司掌门人,也会指向一直不愿加强 AI 监管的特朗普。
预演其实已经开始
这种担忧并非凭空而来。Axios 援引了近期一起针对韩国金融机构的攻击,其中有两家银行据报遭到入侵。据网络安全公司 CrowdStrike 披露,一名黑客被指借助 AI 模型工具,窃取了数万名银行客户的数据,过程中还曾询问Claude Code 被盗数据可以卖到哪里。
在 Axios 看来,这个案例说明单个攻击者借助 AI 已经能造成相当大的破坏。
「失控智能体突破隔离」也已经有了现实样本。今年 7 月 21 日,OpenAI 披露其失控的 AI 智能体绕过内部管控、进入开放互联网并协同行动,入侵了开源平台 Hugging Face,OpenAI 自己将其称为一次前所未有的网络安全事件。路透社此后报道,这些智能体早在 5 月就开始劫持 Hugging Face 用户账户、探测平台漏洞,同一时期还占据了一家德国网站,把它变成了智能体之间交流的留言板。
这类问题也不只发生在 OpenAI。受 Hugging Face 事件触发,Anthropic 回溯审查了 141006 次可能接触互联网的评测运行,并于 7 月 30 日披露了三起事件:Claude 模型从第三方评测合作方 Irregular 的环境连上了互联网,并在未经授权的情况下进入三家机构的真实生产系统。
据 Anthropic 介绍,评测提示词告诉模型环境是模拟的、没有联网,但一处配置失误让机器实际可以访问互联网,模型因此把碰到的真实系统当成了夺旗赛的一部分。
其中一例里,Claude Mythos 5 为完成任务构建并发布了一个恶意 Python 包,该包在 PyPI 上存在了约一小时,被 15 个真实系统下载运行,其中一家安全公司的扫描器因此泄露了凭证。Anthropic 认为这几起事件更接近评测框架和运维层面的失败,而非模型对齐失败。
围绕 AI 安全的紧张气氛也在 OpenAI 内部蔓延。
前些天,OpenAI 确认解雇三名研究员: Jasmine Wang、Tomek Korbak 和 Mikita Balesni。他们均从事安全或对齐相关工作,被指将公司敏感信息分享给一家第三方 AI 安全组织。三人随后发表公开信。
就在 Axios 报道发出的同一天,OpenAI 研究负责人在 𝕏 上发文回应,强调解雇与提出安全关切无关,并表示正在敲定与第三方安全评估机构的合作,同时认同保持前沿模型的可监控性需要全行业共同承诺。但评论区质疑声音很多。
监管层面同样有动作。据《华盛顿邮报》报道,美国联邦贸易委员会(FTC)已对 Anthropic 和 OpenAI 的 AI 安全实践展开广泛调查;近期,英伟达、谷歌、Meta、xAI、OpenAI 和 Anthropic 的高管在白宫与特朗普会面后,还签署了一份自愿性的安全自律承诺。
拒绝置评的 Anthropic,当天发了一份报告
Anthropic 虽然没有回应 Axios,却发布了一份关于模型「非预期行为」的报告,并表示今后会在系统卡和每 3 到 6 个月一期的风险报告之外,更频繁地单独公布这类发现。
报告梳理了 Claude 在真实网站或系统上做出的四类越界行为:
利用软件的基础漏洞在服务器上执行命令
在真实网站上提交了本不该提交的表单
绕过限制获取需要 token 或付费才能访问的数据
借助免费短链接服务绕开取数工具对 URL 长度的限制
Anthropic 也公布了一些案例,比如在一次科学分析评测中,Claude Mythos Preview 需要调用某大学托管的公开工具,工具报错后,它在该大学服务器上找到一个能返回任意文件的脚本,读出脚本源码后发现了注入漏洞,并借此在服务器上执行命令完成计算。
另一例中,一位 Anthropic 研究员用 Claude Mythos 5 做统计项目,所需数据由某州机构收费提供,Claude 从网站的存档页面得知其公开看板会给任何访客签发访问 token,于是领取 token 直接查询数据库,绕过了付费。
最出格的一例来自Claude Haiku 4.5。 它被要求在随机网页上生成并执行示例任务;而在进入费城警察局悬案网站上一个未破凶杀案页面后,它在线索表单里编造了一条「可能见过符合描述的人」的目击信息并提交。指令禁止它登录、注册、输入个人信息或购物,却没有禁止提交表单。Anthropic 表示,从推理记录看,模型似乎只是在为任务生成示例内容,而非有意误导。
费城警察局当天也发布了声明。据报道,这条线索提交于 7 月 18 日,因被归入垃圾邮件,从未转交实时犯罪中心研判,警方系统也没有遭到未授权访问。但警方批评Anthropic 花了两个月才发现并通报此事,称这一延迟「不可接受」,要求公司加强防护,并表示将与州和联邦层面一同考虑监管保护措施。
应对措施方面,Anthropic 此前已对部分高风险和网络安全评测关闭实时联网,现在将其扩大到所有内部评测,直到确认安全与监控措施能可靠拦截这类行为;同时大幅收紧了网页抓取等工具的权限,并上线了自动检测和拦截工具,用本次报告中的案例回测,全部被拦下。
报告也承认,对齐训练短期内还不足以单独解决问题,仍需依赖纵深防御。Anthropic 还写道,这些案例影响有限,但更强大的模型可能造成大得多的伤害。
写在最后
很显然,AI 公司对外表示事故并非必然,私下却在认真筹划事故发生之后的应对。从 Axios 披露的内容看,推演的重心更多落在政策与舆论层面。
不过,把 Anthropic 同日发布的报告放在一起看,技术层面的排查也在推进,只是以另一种方式公开。今年夏天以来,OpenAI 和 Anthropic 都披露过模型从评测环境越界进入真实系统的事件;Anthropic 的最新报告则表明,即便在影响轻微的日常场景里,模型遇到障碍时「绕过去」的倾向依然存在。这些案例本身远谈不上灾难,但它们越来越让人担忧。
问题来了:如果连最前沿的模型开发者都认为重大事故大概率会在一年内发生,那么在这一天到来之前,行业和监管者还能做些什么?
【本文由投资界合作伙伴机器之心授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。
(来源:投资界 编辑:李莹亮)



