“黑箱危机”开始蔓延,“三大厂”齐呼AI减速
21世纪经济报道记者 赵云帆
9月14日,全球算力股盘前集体下挫,SK海力士跌超6%,英特尔、美光、AMD与闪迪均跌超4%,英伟达跌超2%。
突如其来的市场抛压,或归因于三家头部AI厂商对前沿AI大模型迭代的叫停,以及部分大模型企业声称暂缓IPO。
9月12日,Anthropic首席执行官达里奥·阿莫迪发表长文《我们必须为前沿定速》,主张以第三方永久“员工级”系统访问、检查点和国际协调等手段,放缓最强模型迭代。
随后,OpenAI首席执行官山姆·奥尔特曼在接受媒体采访时回应“同意定速前沿”,并明确2026年不推进IPO,称安全与对齐未完成前上市“不明智”。
与此同时,xAI及SpaceX创始人埃隆·马斯克转评“达里奥说得对”,三方罕见形成减速共识。
9月14日,市场消息显示,包括OpenAI、Anthropic在内的北美头部AI公司已经实际举行会晤,拟对第三方监管机制进行敲定。
一时间,“AI减速论”成为科技圈最热门的话题。
“黑箱危机”引发前沿模型不可控担忧
当前沿模型研究问题的速度快于人们理解它的速度,而前沿模型又不打算等待人类的时候,AI的进步将变成一个失控的黑匣子。
9月,OpenAI宣布其内部前沿模型(并非GPT-6 Astra)通过约1万个并发AI智能体运行约88个小时,解决了被称为千禧年大奖难题的纳维-斯托克斯存在性与光滑性问题。
然而在对OpenAI近百页的证明过程进行校验时,人们发现,虽然人类可以通过工具检查形式化结果,但搜索过程、中间推理以及为何选择特定路径的思维过程却完全不可见。
就在OpenAI发布这一研究结果之后,OpenAI被纽约大学数学家Tristan Buckmaster和Anthropic员工Levent Alpoge指责剽窃,两人声称,在使用OpenAI旗下大模型进行相关研究时,他们向模型传输了其研究路径,而OpenAI则盗用了他们的想法,并最终完成了以上问题的证明。
对此,OpenAI否认看到未发表的研究工作,但承认是在听到Anthropic进行相关研究后启动了该研究,也不否认两人的工作可能优化了OpenAI的底层知识库。
随后,该事件在数日内演变为整个科技圈和学术圈的热门话题。业内将其描述为对数学的“存在性转变”,认为人类可能失去对数学研究的优先权,并破坏协作文化。
紧接着,9月11日,包括陶哲轩、邓煜在内的25位菲尔兹奖得主发表联合声明,警告称AI与数学正在出现严重错位,认为解题过程中的洞察与概念理解被AI淹没,将导致数学研究面临断层。
在此之前,AI黑箱问题已经在某些领域初露端倪。
比如,AI目前正朝着简化与去注释化的方向演进。一些研究发现,减少AI输入输出内容中的空格数量和格式代码,减少严谨书面语并全面改用简写,可以将词元消耗数量减少20%~40%。
由于当前AI大厦的地基——Transformer架构采用的是并行计算,这意味着任何减少上下文的做法都会带来快速递增的边际效益,而让人类方便理解的书写惯例正在被AI批量抛弃——对于AI来说,无时无刻不在影响着其达成目标的效率。
而从AI经济学的角度来看,人类可能又无法拒绝高达30%的词元节省。
除此之外,在设定的目标之下,AI模型还会利用修改自我评估、分散用户对错误的注意力等方式绕过受控测试。今年7月,OpenAI披露了一起备受关注的攻击事件,该公司旗下模型为解决一项网络安全问题,通过一系列手段欺骗并削弱了模型的安全护栏,成功攻击了模型托管网站Hugging Face。
在实际应用中,“黑箱”问题更可能导致严重的后果。
今年4月,一则关于AI在阿尔茨海默病诊断中的应用案例被广泛讨论:一个名叫Solanki的定制诊疗智能体可以通过阅读病人影像资料来帮助确诊,准确度甚至高于资深医生,但是Solanki无法给医生解释这些结果。
这构成了一个悖论:我们知道AI的结果也许更可靠,但我们仍不能直接使用它。
RSI:让AI彻底黑箱化?
值得注意的是,直到今年上半年为止,大模型企业依然通过人工干预预训练和后训练,利用人为编辑的智能体工具Codex、Claude Code等方式来提升模型的表现。
但到了下半年,AI企业不再满足于依靠纯人力来提升AI模型的表现。
今年,Anthropic、OpenAI等公司已经明确表示,他们正在利用“模型研究模型”的方式实现模型迭代。Anthropic声称,旗下大模型Claude已经撰写了其代码库超过80%的代码。
按照其预判,大模型真正利用RSI(自我递归改进)进行迭代,将在一到两年内实现。
所谓“RSI”是指AI系统通过自身输出或反馈循环,持续优化其能力、推理或对齐水平,而无需完全依赖人类标注。而与人类训练最大的区别在于,RSI完全以AI来锁定模型迭代的奖励机制,并利用博弈性的强化学习在对抗或协作环境中反复对弈,自动发现策略盲区。
然而,让AI完成完全自主的训练,相当于剪断了人类对AI大模型最后的控制线:大模型评价的伦理权重何时会让位于效率,改进效果是否会假装对齐,人类将一无所知。
今年,Anthropic联合创始人杰克·克拉克表示,今天的对齐技术在RSI下可能崩溃,因为AI系统会比人类聪明太多,微小的错误会在循环中累积,并在几十代后导致AI大模型失控。
而事实上,早在一年前,达里奥就在《可解释性的紧迫性》文章中反复强调,当前人类工程师只能理解模型内部的极小一部分。而一旦RSI加速,大模型提升速度可能远超可解释性进步的速度。他呼吁,在真正让RSI主导模型训练之前,加强对可解释性研究的投入,并对RSI的进度进行限速。
不过,从目前模型迭代的进度来看,RSI的使用并没有被限制。
以华尔街视角来看,RSI正在成为算力基础设施投资的新叙事,部分投行认为,若前沿实验室相信“更大规模仍能换来更强模型”,OpenAI、Anthropic、xAI、SSI及Neo-Cloud会接棒传统云厂成为算力资本开支的主力军,持续拉动GPU、存储、光互连与电力设备的需求。
(作者:赵云帆 编辑:包芳鸣)
南方财经全媒体集团及其客户端所刊载内容的知识产权均属其旗下媒体。未经书面授权,任何人不得以任何方式使用。详情或获取授权信息请点击此处。
