前沿智能进入“1元时代”
21世纪经济报道记者 石恩泽
8月12日晚间,DeepSeek通过API文档更新悄然上线了DeepSeek-V4-Pro-0813,即外界等待近四个月的V4 Pro正式版。
当海外旗舰模型的输出定价还停留在每百万Token数十美元时,这家中国公司把逼近第一梯队的Agent能力,标出了每百万Token输入3元、输出6元的价格,约为Claude Fable 5的1/57。
这并非一次常规迭代。V4 Pro正式版未改动模型架构与参数规模,仅通过重新后训练,便在多项Agent基准测试上较预览版大幅跃升:DeepSWE得分涨了近4倍,终端操作测试Terminal Bench 2.1距Fable 5仅差0.1分。
从V4-Flash正式版以“1元输入、2元输出”横扫开发者市场,到V4 Pro正式版把旗舰级性能拉进个位数元的价格带,DeepSeek正在重写前沿智能的价格锚点。
而就在发布前夕,官方已在API文档中预告:近期将整体上调定价,“预计涨幅较大”——这场定价权之争,才刚刚开始。
Pro把性能上限推向第一梯队,Flash守住性价比底线
从公开架构规格看,V4 Pro为混合专家(MoE)模型,总参数约1.5万亿至1.6万亿(各方口径不一,SemiAnalysis称1.5T,此前官方披露口径为1.6T),每次推理激活约490亿参数;V4 Flash总参数约2840亿,每次推理激活参数约130亿。两者均提供100万Token上下文与最高38.4万Token输出。
本次正式版最重要的变化不是更大,而是更会干活。同样的权重,仅通过后训练策略迭代,Agent能力出现质变。
其中,DeepSWE从12.8分跃升至62.7分,涨了近4倍;Terminal Bench 2.1升至87.9分,距Fable 5仅差0.1分,并超越Opus 4.8;CyberGym实现反超。七项测试中Pro全面领先Flash,性能梯度清晰。
价格上,根据DeepSeek官方API文档,截至8月13日,V4 Pro正式版维持预览版定价,恰好是Flash的3倍。
换算下来,缓存命中价两者几乎持平,差距集中在缓存未命中输入与输出,均为Flash的3倍;并发额度则相反,Pro仅为Flash的五分之一,高并发业务或仍倾向Flash。
此外,V4 Pro正式版补齐了接口能力。新增支持Responses API并适配Codex,同时兼容OpenAI与Anthropic两套API格式,从Claude生态迁移的改造成本较低。
另一个从无到有的变化是多模态。据科技媒体极客公园8月13日发布的API实测报道,预览版为纯文本模型,正式版首次原生支持图像推理。DeepThink引擎可在同一个思考流程中分析图片、解读截图、处理图文混合文档,这对需要“看图干活”的Agent场景而言是从零到一的突破。
不过截至发稿,DeepSeek官方API文档尚未列出图像输入的调用说明,该能力的全量开放节奏仍待确认。
换句话说,DeepSeek用两条产品线完成了分层:Flash以约三分之一的价格、5倍的并发额度承担走量任务,Pro则把国产模型的Agent性能上限推到了第一梯队门口。
横向看,V4 Pro输出价格折合约0.87美元/百万Token,而Claude Fable 5的输出定价为50美元/百万Token,前者仅约为后者的1/57。
市场的正面评价,同样集中在性价比上。第三方研究机构SemiAnalysis称其在智能体任务上,大幅超越英伟达Nemotron3 Ultra;科技媒体实测后评价其“无限逼近Fable 5”;申万宏源、国联证券、民生证券等券商研报亦指出,其性价比利好AI应用产业链。
Harness、多模态与涨价方案成为市场下一步的考题
叫好之外,质疑声同样不少,而这些质疑恰好勾勒出市场的下一步期待。
部分API用户实测反馈,V4 Pro正式版思维链(CoT)表现不及预期。
极客公园实测发现,在复杂代码生成任务中,思考模式下的推理Token可占输出配额的八成以上,挤压了正文代码空间,导致代码截断,开发者需主动关闭思考模式或提高输出上限;目前流传的跑分出自官方渠道,由尚未开放的自研Harness环境测得,第三方复现仍需时间,且HLE、NL2Repo等纯知识与复杂工程测试仍落后于Opus 4.8和Fable 5。
此外,受推理算力不足影响,官方API近期多次出现性能下降,Pro版500的并发上限对高并发业务并不友好。同时,官方涨价预告悬而未决。目前每百万Token输入3元、输出6元的定价更像一个“阶段性低价窗口”。
不过,质疑并未动摇市场对V4 Pro正式版的基本判断。模型的能力上限已被证实,剩下的都是何时补齐的问题。
市场目前的关注点,已转向三件事。
其一是Harness。记者了解到,DeepSeek近期已在密集组建Harness(智能体运行框架)团队,由崔添翼挂帅对外招聘,“DeepSeek Harness团队”官方微信公众号已完成注册。
DeepSeek内部有个公式:Model + Harness = Agent。模型是发动机,Harness是方向盘、变速箱、刹车。没有Harness,模型就是个裸API。有了Harness,模型才能变成真正能干活的产品。
Claude Code与Codex的体验差距从来不只是由底层模型决定的。因此,Harness何时开放,被视为DeepSeek的下一张牌。
其二是多模态的开放节奏。图像推理的补齐让V4 Pro正式版迈出了从纯文本到多模态的第一步,但官方文档与技术报告尚未确认该能力,全量开放时间表不明。另外,视频等更完整的多模态能力,或仍需等待后续版本。在Opus、GPT等对手均已标配视觉能力的背景下,这一步的落地节奏尤为关键。
其三是涨价方案与算力供给。DeepSeek已实行峰谷分时定价,新一轮整体涨价的幅度与节奏,将直接检验其性价比叙事的成色。而华为昇腾950超节点的批量上市进度,决定着Pro级别模型的推理供给能否跟上需求。
对行业而言,V4 Pro正式版的意义在于,前沿Agent能力的价格锚点被再次拉低。当逼近第一梯队的性能以百分之一量级的价格供给,中间层模型将最先感受到压力。
(作者:石恩泽 编辑:孙超逸,张伟贤)
南方财经全媒体集团及其客户端所刊载内容的知识产权均属其旗下媒体。未经书面授权,任何人不得以任何方式使用。详情或获取授权信息请点击此处。



