“单任务成本仅为Claude Opus 5的1/8”,阶跃星辰Step 5 Preview跻身全球开源前三:榜单之外,场景落地仍需攻坚

每日经济新闻
2026-09-21 08:28

来源:每日经济新闻

“单任务成本仅为Claude Opus 5的1/8”,阶跃星辰Step 5 Preview跻身全球开源前三:榜单之外,场景落地仍需攻坚

每经记者|郑欣蔚每经编辑|余婷婷

1/8,这是阶跃星辰为Step 5 Preview标出的成本注脚。

9月20日,这家正处于赴港IPO(首次公开募股)关键窗口的国产大模型公司,发布了新一代开源旗舰基座模型Step 5 Preview。600B总参数、27B激活、稀疏MoE架构、100万Token(词元)上下文,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)上拿到44分,位列全球开源模型前三。

图片来源:Artificial Analysis网站

另一个阶跃星辰想要强调的数字是,“单任务成本仅为Claude Opus 5的1/8”。在其看来,“这意味着,Step 5 Preview 在同样成本下获得更强智能,也让同等能力能以更低成本投入实际工作——进一步推动AI模型的帕累托前沿”。

阶跃星辰表示,过去大模型Scaling(规模化扩展)的核心,是用更多计算换取更强智能;但随着模型规模扩大、智能体任务复杂度提升,计算成本也在快速攀升。因此下一阶段模型Scaling的关键,是提升计算转化为智能的效率。

从今年2月发布的Step 3.5 Flash、5月上线的Step 3.7 Flash到Step 5 Preview,阶跃星辰连续几代基座模型都在追问同一个问题:如何更高效地把计算转化为模型能力?

再一次押注模型效率,Step 5 Preview这张答卷的成色究竟如何?“1/8成本”的参照系是否经得起推敲?编程与金融两个战场的真实竞争力又在哪里?

效率的赌注:1/8成本的成色与技术坐标

阶跃星辰表示,随着Agent从“回答问题”走向“完成任务”,日常工作主力模型的评判标准不再只是单项能力足够强,而是要在能力、成本、效率和场景覆盖之间实现更好平衡,Step 5 Preview正是围绕这种平衡而设计。

与近期引发广泛关注的2.8万亿参数模型Kimi K3相比,Step 5 Preview用不到其五分之一的体量,在AA综合智能指数上拿到相同分数,在国产模型中得分仅次于45分的Qwen3.8 Max和GLM-5.3。

“这是一次教科书式的达标交卷,但离真正的代际跃迁还差一步。”快思慢想研究院院长田丰在接受《每日经济新闻》记者采访时就阶跃星辰新一代基座模型的技术坐标解读道,国产大模型的密集更新节奏,正在把“分数领先”的含金量不断稀释,值钱的不再是某一次登榜,而是能不能在成本曲线和智能曲线之间,持续跑出比对手更陡的斜率。

从成本来看,“1/8成本”的参照对象是目前市面上最贵的模型之一。如果对标AA测算口径下,参数规模相近的DeepSeek最新模型V4.1 Flash完成标准智能任务0.27美元的加权平均成本,Step 5 Preview的成本达到0.71美元,处于更高水平。

在田丰看来,Step 5 Preview并没有触及行业真正的成本地板。与此同时,推理硬件的性能提升速度,决定了全行业的推理成本大约每12到18个月就会有明显下降;若仅靠价格成本这一张牌,既容易被更大规模玩家的补贴战覆盖,也容易被行业整体成本下降自然填平,价格代差无法长久。

但价格战从来不是阶跃星辰真正想打的牌。成本优势是结果,效率是方法;低价标签的壁垒容易消散,但持续下压成本曲线的工程能力却不会。这才是阶跃星辰连续三代押注“效率”的真正意图:不是比谁今天更便宜,而是比谁能在同样的参数体量下,跑出更强大的智能表现。

所以,阶跃星辰把“效率”上升到战略层面,这不是某一代模型的特性,从Step 3.5 Flash到Step 3.7 Flash再到Step 5 Preview,其反复在证明一件事:能在更小参数规模下,逼近更大参数模型的能力。

田丰认为,Step 3.5 Flash总参数196B、激活11B,Step 3.7 Flash总参数198B、激活11B,这两代参数规模几乎原地踏步,是阶跃星辰刻意压住规模、在同一体量下死磕效率打磨;Step 5 Preview才是真正进行实质性参数扩容的产品。这一过程不是一路线性放大稀疏度的叙事,而是先在小规模上把效率打磨到位、验证清楚,再决定要不要扩容,体现出更谨慎的工程节奏。这比“越做越大”的路线多了一层自我约束,背后其实是整个行业规律的显现,不只是阶跃星辰一家的选择。

“Anthropic CEO(首席执行官)Dario Amodei提出过一个判断:Scaling law(规模定律)本身没有失效,但‘把算力转化为智能’的转化效率,正在成为新的竞争维度。这跟摩尔定律的历史转折很像——当晶体管数量堆叠的边际效益递减,行业竞争的焦点从‘数量’转向‘每瓦性能’。阶跃只是在这条曲线上跑得比较早、比较坚决的企业,方向是行业的必然,节奏是阶跃自己的选择。”田丰指出,Step 5 Preview的发布不是一次改变竞争格局的跃迁,而是阶跃星辰在效率这条自己选定的赛道上又往前跑了一步。

场景的考验:Coding红海与金融蓝海

每经记者注意到,Step 5 Preview把重点检验场景锚定在AI Coding(人工智能编程)和金融领域,这两个方向的选择本身就值得玩味。

编程是大模型商业化最成熟的场景,也是竞争最激烈的红海。IDC数据显示,2025年中国AI编程市场规模为3.99亿元,预计2026年底将飙升至11.73亿元。这一战场上,编程测试SWE-bench上长期领先的智谱GLM系列模型在企业级市场攻城略地,Kimi则以超长上下文的差异化优势建立口碑,更有阿里这家在中国AI编程市场占有近50%份额的大厂一同角逐。

阶跃星辰能在这一赛道分得一杯羹吗?就测评数据来看,Step 5 Preview在DeepSWE v1.1这一软件工程测试上获得67.7%的得分,甚至略高于Kimi K3与GLM-5.3。

不过,在田丰看来,Coding agent(编程智能体)竞争的胜负手不是单次问答的基准测试分数,而是agentic loop(智能体循环)能不能稳定跑通、工具调用会不会中途崩溃。此外,如今智谱GLM Coding Plan、Kimi的一系列模型已在开发者的IDE插件、订阅习惯、工作流中扎根,占据用户心智,即便Step 5 Preview的编程分数打平甚至反超,开发者迁移时会面临工具链重新集成的沉没成本,想要撬动这一心智壁垒并不容易。

金融场景,则是另一个故事。相比于打得火热的编程领域,这一领域相对是一片仍待开发的蓝海。阶跃星辰把金融选为Step 5 Preview的核心验证场景,不是偶然:金融连接宏观经济、政策监管、行业周期与公司经营,要求模型具备专业知识、跨行业理解、证据核验、复杂问题拆解等综合能力。值得一提的是,Step 5 Preview在Frontier Finance这一金融领域基准测试中的得分也高于GLM-5.3、Kimi K3与DeepSeek V4.1 Flash。

图片来源:阶跃星辰官网

就商业化落地而言,9月17日,Kimi发布金融行业解决方案,涵盖超10项权威数据源、9项金融技能和5项合规安全措施,以及机构级的数据建模和报告交付能力,同时官宣数十家金融机构合作伙伴。智谱在金融场景也已与多家银行合作部署模型落地,今年6月已与中国银联签署战略合作协议。

在海外,AI在金融领域的应用前景也受到广泛关注。9月,OpenAI推出金融行业的定制化服务ChatGPT for Financial Services(金融版ChatGPT)。而在今年5月已经推出Claude for Financial Services(金融版Claude)的Anthropic,也于9月进一步推出了Claude for Financial Advisors(面向理财/金融顾问的Claude)。公开资料显示,截至今年7月,金融服务与保险已占Anthropic年度经常性收入的25%,仅次于编程与软件工程的36%;Anthropic内部预计,金融领域有望在2027年超过编程领域,成为其最大的垂直应用市场。

阶跃星辰创始人、CEO姜大昕近日公开表示,垂类大模型正与金融行业生产系统加速融合,背后是模型从单点应用能力向基础设施的跃迁。在这一充满前景的领域,阶跃星辰需要证明的,不仅仅是在测评分数上的领先,而是其模型、智能体产品等能否在更多金融机构中完成嵌入核心业务的现实落地。

从Step 3.5 Flash到Step 5 Preview,阶跃星辰证明了一件事:在效率这条赛道上,它的执行力足够坚决,但执行力不等于胜利。随着推理成本自然下降,单纯的价格优势终将被抹平。真正的考验在场景里:Coding的用户心智壁垒需要时间去撬动,金融领域的核心业务嵌入需要案例去证明。Step 5 Preview把阶跃星辰重新送进了开源第一阵营,但从“第一阵营”到“不可替代”,中间还需要解决很多难题。

(来源:每日经济新闻 编辑:李莹亮)