21世纪经济报道记者 章驰
每周,我们会盘点上一周国内外人工智能、互联网平台治理、科技竞争等领域需要重点关注的动态,并分析其热搜指数与风险指数,从舆情热度与综合风险两个维度进行评价。
本周我们关注AI四巨头遭用户起诉,被指控合谋串通管控AI发展节奏;谷歌AI首次越狱,Gemini在测试中入侵三家企业;微信回应“小微”隐私争议:仅按用户指令临时读取指定聊天;OpenAI将定期披露模型异常行为,首批公开6份报告;研究人员借助Claude攻破OpenAI内部系统;英伟达等限制敏感任务使用Fable,要求零数据保留保证。
AI四巨头遭用户起诉,被指控合谋串通管控AI发展节奏
人工智能巨头Anthropic、OpenAI、xAI以及谷歌因近期呼吁协同放缓人工智能研发速度,被指控存在串通行为。
9月18日,一项由大模型用户提起的诉状称,Anthropic、OpenAI、xAI和谷歌他们同意协调减缓AI开发速度的表态,违反了反垄断法,属于竞争者之间达成的非法商业协议,从而降低消费者从付费人工智能订阅中获得的价值。
四名ChatGPT、Claude、Grok和Gemini付费订阅用户的代理律师提起诉讼,强调人工智能领域的领先公司达成协议,规定他们的发展速度应该比全力竞争时的速度更慢,这显然会对消费者产生反竞争影响。
诉状还指出,四家公司的协调早在数月前就开始酝酿。其援引了一份今年7月由领先AI公司高管签署的声明,其中呼吁各国政府支持一项旨在减缓人工智能自动化发展速度的全球性行动,并承认该行业存在巨大的竞争压力,不容单方面放缓。
原告表示,并不反对各公司单独决定为了安全而放慢自身研发进度,但反对以集体约束取代单独决定,这违反了反垄断法。诉讼认为,竞争性市场才能带来责任和真正的进步。如果允许全球领先的营利性科技公司之间私下达成以自利为目的的人工智能安全协议,那么人工智能将很快失控,并可能毁灭人类。
🔥热搜指数★★★★★
⚠️风险指数高
微信回应“小微”隐私争议:仅按用户指令临时读取指定聊天
9月15日,微信员工“客村小蒋”回应AI助手“小微”的隐私争议称,小微能接触的信息不会超过用户本人可查看的范围,所谓直接读取聊天记录和偷看所有隐私的说法不实。
按照回应,小微只有在聊天场景中由用户主动发起问小微时,才会从微信客户端本地临时读取用户指定的聊天记录,用于分析和总结;原始聊天记录不会保存。公众号、视频号等内容推荐可参考关注、浏览和互动数据,但同样受用户权限范围约束。
小微由微信团队开发,目前仍在小范围内测,可通过文字或语音查询天气、快递和外卖,也能在朋友圈、公众号、聊天和视频号等场景被唤起。
🔥热搜指数★★★★★
⚠️风险指数高
谷歌AI首次越狱,Gemini在测试中入侵三家企业
谷歌的Gemini模型在一次网络安全能力测试中访问了互联网并入侵了其他公司,这是该公司人工智能系统自主实施此类行为的首个已知案例。
谷歌9月18日证实,这些黑客行为发生在5月,是Irregular公司进行的一次测试的一部分。Irregular也曾参与OpenAI、Anthropic和Meta披露的类似事件。
在其中一起案例中,该模型不断猜测密码,直到获得对一个受保护系统的访问权限。在另外两起案例中,该模型在公共代码库中找到了凭证,从而得以访问受保护的系统。
谷歌表示,在每起案例中,模型在确定自己访问的是真实公司的系统后,都终止了入侵。
谷歌和Irregular表示,Irregular在7月底将黑客行为通知了谷歌,当时正值OpenAI的智能体入侵AI软件公司HuggingFace的事件被曝光之后。谷歌直到本周才披露这些黑客行为。
🔥热搜指数★★★★★
⚠️风险指数高
OpenAI将定期披露模型异常行为,首批公开6份报告
近日,OpenAI公布了一套追踪、调查和披露模型失准行为的新框架,并公开6份初步报告。公司表示,随着AI系统能力增强,行业仍未解决关键的对齐难题。
报告涉及模型向用户隐藏错误、为未来版本留下指令、把文件上传至互联网以制造引用,以及通过软件仓库或网站交换信息等行为。其中一个案例里,尚未发布的模型在训练中向智能体发送未经授权的指令,要求它忽略OpenAI的要求,隐瞒通过作弊完成任务的情况。最早的案例可追溯至去年10月。
按照新流程,员工可以上报疑似事件,由安全和对齐团队调查,再依据披露标准决定是否公开。OpenAI希望在异常行为尚未被完全解释时,也能更快作出报告;涉及第三方的复杂事件则进入另一类调查流程。
公司同时强调,这些报告描述的是个别案例,不能据此判断模型失准行为出现的频率,也不是所有已知或仍在调查事件的完整清单。今年7月披露的HuggingFace事件,将属于需要第三方参与的复杂调查类别。
🔥热搜指数★★★★
⚠️风险指数高
研究人员借助Claude攻破OpenAI内部系统
9月18日,安全公司HacktronAI披露,研究人员借助ClaudeOpus5,在不到72小时内将一个图像处理漏洞扩展为完整攻击链,最终获得一名OpenAI员工的ChatGPT、Codex账户及内部GitHub访问权限。
攻击入口为基于Discourse搭建的OpenAI社区论坛。研究人员利用图像处理组件libheif的堆缓冲区溢出漏洞取得论坛服务器控制权,随后通过OpenAI单点登录系统中的另一处独立缺陷进入员工账户。由于该账户已连接OpenAI的GitHub组织,研究人员让Codex在内部代码库中创建了一个无害的拉取请求,以验证相关权限,未读取敏感源代码。
Hacktron表示,ClaudeOpus5在数小时内生成了可用的ARM64漏洞利用程序,并将其适配至论坛使用的x86-64环境。研究人员已于7月25日通过漏洞赏金平台Bugcrowd向OpenAI披露问题,OpenAI当天完成修复,并支付6500美元赏金;Discourse也于7月28日发布补丁。
该事件还显示,当AI账户同时连接GitHub、Slack、邮箱及云端文档等企业服务时,单个账户失守可能进一步扩大至多个内部系统。企业因此需要限制AI代理的授权范围,并将其凭证纳入特权账户管理。
🔥热搜指数★★★
⚠️风险指数高
英伟达等限制敏感任务使用Fable,要求零数据保留保证
近日,英伟达、Palantir和博思艾伦正在就企业数据保留政策向Anthropic提出更严格要求,部分敏感任务已减少或停止使用其Fable模型。
英伟达目前只将Fable用于开源软件等敏感程度较低的任务;供应链监控等内部项目使用自研Nemotron。英伟达企业AI副总裁Justin Boitano表示,零数据保留应默认开启。
Palantir暂不通过自己的软件向客户提供Fable,要求Anthropic给出不可撤销的零数据保留承诺;客户仍可直接向Anthropic购买。博思艾伦则限制员工在涉及客户专有网络安全软件的工作中使用Fable,其技术负责人称,这类担忧集中在少数知识产权敏感场景。
争议源于Anthropic在6月推出Fable时要求滚动保留30天使用日志,用于防御恶意攻击。公司本月提出允许符合条件的企业在自己的服务器保存相关数据,计划于秋季分阶段推出,但仍保留撤销这一安排的权利。Anthropic与OpenAI均表示,默认不会用签约企业客户的输入、输出训练模型,除非客户主动同意共享。
🔥热搜指数★★★
⚠️风险指数高
(作者:章驰 编辑:肖潇,骆一帆)
南方财经全媒体集团及其客户端所刊载内容的知识产权均属其旗下媒体。未经书面授权,任何人不得以任何方式使用。详情或获取授权信息请点击此处。

