Kimi能否开启“DeepSeek 2.0时刻”?
作为全球参数规模最大、性能最强的开源大模型,Kimi K3发布一周以来,热度持续发酵。Kimi一度因算力资源供不应求限制会员新用户订阅,其突破更为产业界和美股科技股带来冲击,甚至被形容为“DeepSeek 2.0时刻”。
记者采访了解到,Kimi K3与去年的DeepSeek均定义了开源大模型的新高度,因而席卷全球科技圈。此次Kimi K3的走红让外界回归聚焦大模型的性能本身,重新证明了规模法则(Scaling Law)对提升模型性能的有效性,同时引领了接下来大模型处理长程任务、进行自学习进化的发展方向。
比肩“DeepSeek时刻”的阶段性出圈
Kimi K3是一个 2.8 万亿参数模型,是全球首个开源的 3万亿级别模型。虽然其整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol,但它在相关评测中展现出前沿水平的能力,并稳定超过了其他所有模型。
Kimi K3一经发布即引发美国科技股下跌,有华尔街机构用“DeepSeek 2.0时刻”形容其冲击性。高盛研报认为,Kimi K3标志着中国模型走向定价权的全新节点。摩根士丹利表示,Kimi K3证明中国大模型在规模、性能、定价层面对美国头部模型实现“全方位追赶”。马斯克也给予了Kimi K3“令人印象深刻”的评价。
科技研究机构Omida首席分析师苏廉节对记者说,从K3模型受欢迎的程度来看,其热度确实与去年的DeepSeek有所相似。这种热潮反映了业界对表现卓越且性价比优越的开源大模型仍抱有极大的热忱。
和DeepSeek类似,Kimi K3将开源大模型的能力推向了新的高度。“2.8万亿的参数规模在开源界是数一数二的存在,K3以开源模型的态势展示出能与海外最强闭源模型一决雌雄的能力,实属比较少见。在成本方面,虽然Kimi并未特别披露,但作为开源模型,其性价比必然具有一定领先性。”苏廉节说。
某种意义上,DeepSeek曾首次让海外认识了中国大模型的追赶速度和创新能力,同时引发了国内全民性的追捧。即使这种光景难以复现,但业界认为,这两次出圈都体现了我国头部大模型企业追求AGI(通用人工智能)长远目标过程中的里程碑式成果,双方均可视为竞赛中的“阶段性王者”。
早期投资Kimi的蓝驰创投有关负责人对记者表示,DeepSeek和Kimi都代表了中国最优秀的大模型公司,其实一时爆火并非公司的期望。他们的目标就像Kimi K3的官方推文标题一样——追求“智能的前沿”。虽然这一目标还远远没有实现,但阶段性成果有助于公司获得更好的人才、资金等资源。
引领“堆参数”“卷性能”新阶段
此次Kimi K3凭借2.8万亿的参数规模,一跃成为全球智能水平第三的大模型,将外界的关注和产业竞争的焦点再次拉回大模型性能本身,也为其他大模型进一步提升能力带来了借鉴。
“大模型在实现AGI之前,智能水平的提升始终是大模型公司的核心。”蓝驰创投有关负责人说,因为目前的AI距离其理论上限还相差甚远,商业化的优先级仍不及智能水平的提升。目前几家大模型公司包括Kimi在内,已经取得了可观的商业化成果,但本质上,这是大模型性能提升的副产品。只要模型能力不断提升,用户和收入自然会涌进来。
Kimi K3也再次让“堆参数”这一路径回到大众视线。工信部信息通信经济专家委员会委员盘和林对记者表示,堆参数正是当年ChatGPT开创的路径,但当参数达到一定规模后,业界一度认为继续堆参数对模型的性能提升有限,部分放弃了这条路线。如今Kimi K3的成功,再次证明了参数规模效应对模型性能有显著提升效果。
盘和林认为,堆参数规模的道路非常成熟,预计各大模型未来也会在参数上继续竞赛。这也让大模型对算力提出新需求,从而给算力产业带来新的国产化替代机遇。
除了综合性能,Kimi K3重点优化了长程、高难任务的处理。在对K3模型的能力介绍中,Kimi列举了其在长程编程、知识工作和推理等前沿智能场景中的能力。一个典型案例是,K3在完成推理芯片行业研究的任务中,经过120多轮递归自我改进,完成了2800多次网页搜索与抓取、1100多次终端数据拉取等,合计超过11000页资料。
这种“自主长程执行”的能力,正是今天行业关注的核心方向之一。蓝驰创投有关负责人解读说,日常聊天就是短程任务的代表,而长程任务,往往是指交给AI一个相对复杂、边界没那么清晰的命题,它需要自主想办法、调用工具,一步步推进落地。在上述推理芯片行业研究的任务中,关键不在于结果,而是任务全程由K3自主推进——自己迭代思路、规划路径、纠错优化。
在这类长程任务中,业界进一步关注大模型的自学习进化能力,即大模型能否在每一轮思考和输出之后,进行自我判断,甚至自我提升和优化。
“理想状态下,这意味着大模型可以在无人干预的状态下自主完成下一代模型的预训练或微调。当前大模型还无法脱离人类辅助训练,但我们希望自学习进化可以逐渐在模型训练中占到更高比重。”蓝驰创投有关负责人说。
作者:刘怡鹤
(来源:上海证券报 编辑:张明艳)
