马斯克预言成真?Claude一个月攻下理论物理「九圈」难题,中国团队用GPT-6同时算出
来源:投资界
9月25日,Anthropic公布Claude在理论物理领域的一项新成果。
Claude计算出了平面 N=4 超对称杨-米尔斯理论(planar N=4 super-Yang-Mills)中的九圈六粒子散射振幅。
这道题,是前理论物理学家Matt von Hippel在8月公开向AI公司下的战书。
一个月后,挑战被破解。整个过程几乎没有科学上的人工指导。总成本约1000到2000美元,其中核心计算只花了约100美元。
该领域八圈纪录的保持者、斯坦福大学和SLAC国家加速器实验室教授Lance Dixon亲自验证了结果。他坦言,自己原本认为这个问题太难,不可能直接算出来。
几乎在同一时间,中国科学院理论物理研究所的何颂也表示,他的课题组借助GPT-6已经拿到了九圈结果的大部分。
就在几天前,Anthropic刚刚宣布自建湿实验室,并公布了Claude自主发现全新DNA系统ART的成果。
一周之内,从生物到物理,Anthropic正在密集亮出Claude的科研底牌。
难道马斯克预言成真了?近日马斯克在一条AI4S的相关推文中预言:人工智能最迟在明年年底或2028年,就会在所有(科学)领域占据主导地位。
计算物理学、计算化学、计算生物学、计算医学.....甚至计算考古学。逼真的模拟、大数据分析,以及AI将无处不在。
AI4S的新时代,已经全面开启。
01一封战书,一个月被AI破解
Matt von Hippel曾是理论物理学家,如今是科学作家,长期在个人博客上写物理。
近几年,他写物理越来越绕不开AI,但AI圈的专家意见严重分裂:一派认为几年内就会出现超级智能,另一派认为大模型已接近天花板,连像样的物理研究都做不了。
他不想站队,决定亲自出题。
图:Matt von Hippel的博客
有意思的是,他特意避开了数学方向的题目。在他看来数学突破靠灵感,难度很难提前判断。计算难题则不同,需要多少机器跑多少天这个过程可以直接对比的。
于是在8月,他点名挑战AI公司:用普通学者拿得到的计算资源,判断 N=8 超引力在七圈是否发散,或者把N=4超杨-米尔斯算到九圈。
Anthropic选了后者,并最终成功了。
02九圈有多难?领域纪录停在八圈
这道题出自理论物理中“散射振幅”的方向。
散射振幅描述的是粒子相撞时发生各种反应的概率。算得越准,越能和大型强子对撞机的实验数据比对,一旦对不上,就可能指向暗物质等新物理。
圈数越多,计入的量子涨落就越多,结果越精确,但计算量也急剧上升。Matt 在战书里表示:圈数是结果精度的粗略衡量,而且每多一圈,计算量通常按指数、甚至阶乘增长。
所以,九圈的意思是把精度一直推到第九层修正。现实中的粒子物理计算大多停在两圈,最精确的预言之一也只用了五圈。
N=4超杨-米尔斯是一个“玩具模型”,每个粒子配有四个超对称伙伴,不描述真实世界。但正因为结构高度对称,它反而更好算,成了物理学家打磨新方法的试验场。
计算采用的是一种叫bootstrap(自举)的技术。这个过程有点像数独数独。先列出所有可能的答案,再用各种已知规则逐一排除,直到只剩*解。
此前的纪录是八圈,由Dixon团队在2023年取得。而且走的是一条间接路线。先算更简单的“形状因子”,再借助一种奇特的“对跖对偶”对称性,绕回振幅本身。
在业内看来,直接再往前推一圈并不现实。
8月底,Anthropic的两位物理学家Liam Fitzpatrick和Siddharth Mishra-Sharma联系作者表示挑战已经完成。
他们没有动用大规模算力,而是用了Anthropic面向科学家的平台Claude Science,驱动模型为Fable 5.1。
整个流程简单得出奇。研究者先问Claude哪道题它最有把握。随后只给了一句题目:计算平面N=4超杨-米尔斯中六粒子振幅的九圈结果。
此后,人类几乎只是下指令让它继续。其中一次,研究者睡前交代Claude一直算下去,每4到6小时汇报一次进展。
结果Claude不仅算出了九圈结果,还用两种方法各完成了一遍:一种是原始的bootstrap路线,另一种是Dixon团队的间接形状因子路线。
成本方面,任选一种方法,终端用户约需1000到2000美元,主要花在Claude长时间运行上。真正的计算部分用Python和SymPy完成,只花了约100美元。
作者感叹,在他十年前做研究时算是一笔不小的开销,如今只要理由充分,谁都负担得起。
更戏剧性的细节来了。
Anthropic联系作者几天后,中国科学院的何颂团队也发来消息:他们同样算出了九圈结果的大部分。
何颂与 Jirong Jing、Xiang Li 在 Zenodo 上公开了一份数据集,题为《六胶子 MHV 振幅直至九圈的符号》,涵盖二圈至九圈的符号(symbol)数据。
何颂团队也用了AI,不过是GPT-6,但只用于计算部分约束条件,整体框架仍由人类主导。
同一个前沿问题,两种范式几乎同时抵达终点。一边是几乎无人参与的AI自主计算,一边是人类主导让AI助攻。
但他真正佩服的,不是计算量,而是这套流程的脆弱性。整个计算环环相扣,只要一处出错就会全盘崩溃,而且大量构造细节琐碎到论文里都不会完整记录。这意味着,Claude必须从零写出全部代码。
不过被抢先,Dixon并不沮丧。一方面,他的团队本就在用自研transformer模型预测更高圈数,口号之一就是有能力验证机器给出的任何答案。
另一方面,Claude用的全是他们多年积累的方法,连结果格式都与此前保持一致。换句话说,他在验证Claude,Claude也在验证他们过去的所有工作。
Dixon甚至评价:除合作者外,Claude比任何人都更懂他们2019年和2023年的论文。
结果最终将由人类研究者整理发表。
03不是超级智能,但已经足够可靠
尽管结果亮眼,出题人Matt von Hippel的评价却相当克制。
他原本希望看到AI用意想不到的新方法突破计算极限。但实际上,Claude用的都是已知方法,只是比前人多投入了一些算力,工程习惯更好一些,谈不上超级智能。
不过,他从中得出了两个判断。
第 一,低垂的果实比想象中多。即便目标明确,专家也可能高估它的难度。那些常年劝物理学家多雇几个程序员的计算机背景人士,这次被证明是对的。
第二,AI已经足够可靠。这类计算繁琐易错,作者坦言换作自己,一周的工作大概率要拖成两周,因为第 一次几乎必然出错。而这一次,全程没有外部专家介入,平台自己把计算推到了终点。
值得注意的是进步速度。今年3月,AI做物理项目还像个学生,任务小、需要手把手指导、错误不断。仅半年后,它完成的已是通常由领域顶 尖专家攻克的前沿计算。
Dixon则留下了一句更有分量的话:真正值得深刻反思的时刻,会是大模型先于人类提出新的物理原理的那一天。
04 Anthropic的科研版图,正在成形
把时间线拉开看,这不是一次孤立的展示。
9月23日,Anthropic宣布成立生命科学研究组、自建湿实验室,同时公布Claude自主发现全新DNA系统ART。两天后,便是高能物理领域的九圈振幅计算。
同一时期,Anthropic还公布了另一项成果:Claude在不到四周内优化了30多个开源生物分子建模模型,平均提速约4倍。
从生物学发现,到计算工具优化,再到理论物理前沿计算,贯穿其中的是同一个平台:Claude Science。
Anthropic想让Claude扮演的,显然不只是查文献、写代码的助手,而是科研流程中最昂贵、最耗时的那个执行者。
当算得出来变得越来越便宜,科研的瓶颈正在转移:谁能提出好问题,谁能验证答案,谁就握有下一阶段的话语权。
【本文由投资界合作伙伴微信公众号:智药局授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。
(来源:投资界 编辑:李莹亮)







