混元进了第一梯队,腾讯AI形成了自己的打法

东方财富网
2026-08-31 18:36

来源:东方财富网

8月28日,腾讯发布并开源新一代大语言模型Hy4 preview。

这款模型总参数7700亿,每次推理激活490亿参数,上下文长度达到100万Token。按照腾讯公布的测试结果,Hy4 preview在编程、Agent、办公和科学研究等任务上的表现,已经接近国内领先的开源模型。

腾讯混元终于进入了国内第一梯队,姚顺雨加入腾讯后,混元从预训练和强化学习基础设施开始重建。今年2月启动底层体系重构,4月23日发布Hy3 preview,7月推出Hy3正式版,8月28日又发布Hy4 preview。从重建开始计算,混元已经把大版本的迭代周期压缩到两个月左右,开始接近OpenAI、Anthropic和智谱 等头部模型厂商的更新节奏。

更难的是,腾讯是在重建地基的同时跑出了这个速度。过去,大模型公司一次组织调整或者训练体系重构,往往需要经历较长的停顿。混元则是一边重新建设预训练、强化学习和评测基础设施,一边把新模型投入腾讯内部产品,通过真实业务反馈继续完成后训练。

版本间隔不断缩短,模型能力的跃升幅度也在扩大。Hy3 preview被姚顺雨称为“混元大模型重建的第一步”,到了Hy4 preview,腾讯已经能够把自己的模型与GLM-5.3、Kimi K3等国内领先模型放在同一组测试中比较。

混元的研发体系已经开始形成持续迭代能力,对于模型竞争而言,偶尔做出一款高分模型并不困难,真正稀缺的是每隔几个月稳定推出下一代模型,并让产品反馈、训练数据和算力投入形成循环。

Hy4 preview上线前两周,腾讯发布二季度财报。腾讯管理层在业绩会上预告Hy4即将推出,并表示未来几个月资本开支的首要用途,是训练规模更大、能力更强的混元模型。

发布前三天,腾讯又披露了集团高级执行副总裁、云与智慧产业事业群CEO汤道生对过去两年AI业务的复盘。

面对“腾讯做AI慢了”的质疑,汤道生没有完全回避。他承认,混元经历过多个阶段和多次重构,公司算力不足一度拖慢模型训练和产品发展。但他把大模型竞争比作一场“可能才跑完头一公里”的马拉松,认为市场格局和商业模式尚未确定,“熬得久比起得早更重要”。

他的判断是,基础模型仍然需要持续投入,但腾讯不能只围绕参数规模和评测排名竞争。算法决定模型能力的上限,工程体系决定能力落地的速度,消费互联网和企业服务积累的场景,则是腾讯能够长期参与竞争的核心资源。

三天后发布的Hy4 preview,像是腾讯对这些问题交出的一份阶段性答卷。它证明算力投入和混元重建已经开始转化为模型能力,也让外界对腾讯AI的关注点进一步发生变化。

当模型短板开始补齐,腾讯接下来需要回答的,就不再只是混元能否进入第一梯队,而是微信、广告、游戏、腾讯云 和Agent产品,能否把模型能力转化成真正的商业回报。

01

混元补上了最关键的一块短板

腾讯混元最近半年的进步速度明显加快。今年4月,腾讯发布Hy3 preview,总参数2950亿,每次激活210亿参数,支持25.6万Token上下文。姚顺雨当时把它定义为“混元大模型重建的第一步”。

7月,Hy3正式版上线。8月底,Hy4 preview的总参数已经扩大到7700亿,激活参数增加至490亿,上下文长度则提高到100万Token。参数扩大的同时,腾讯把更多资源放在了编程、Agent和办公等生产力场景上。

在腾讯公布的内部盲测中,163名内部专家围绕203个工程任务,对Hy4 preview、GLM-5.3和Kimi K3进行了比较。Hy4 preview的平均得分为2.99,GLM-5.3和Kimi K3分别为2.92和2.94。从胜负结果看,Hy4 preview对GLM-5.3取得46.8%的胜率、40.4%的负率;对Kimi K3取得51.2%的胜率、40.9%的负率。

Hy4 preview已经能够和两款国内领先模型正面比较,但优势并不大。腾讯自己使用的描述也是“略优于”,而不是明显领先。

其他测试呈现出类似结果。在编程和Agent相关基准中,Hy4 preview较Hy3出现了明显进步。在DeepSWE测试中,其得分由Hy3的28.0提高至64.3;Terminal Bench 2.1得分由70.8提高到85.4。这些成绩支持Hy4 preview进入国内开源模型第一梯队,但还不能证明它已经稳定领先。一方面,主要评测数据仍由腾讯提供,内部盲测也发生在腾讯自己的产品和任务环境中。另一方面,模型刚刚发布,独立评测机构和开发者还没有完成足够多的真实复杂任务测试。

大模型在公开基准上取得高分,与长期稳定完成研究、编程和报告写作,仍然不是一回事。模型只要在一个长任务中出现少量事实错误、丢失指令或者调用工具失败,就可能显著增加人工核查和返工成本。因此,目前更准确的结论是:Hy4 preview已经获得了进入第一梯队的资格,但这个位置还需要真实使用来确认。

它的参数规模也值得讨论。过去一年,国内头部模型再次走向大规模化。阿里的Qwen3.8-Max总参数达到2.4万亿,Kimi K3达到2.8万亿。相比之下,Hy4 preview的7700亿总参数明显更小。

Hy4本身仍然是一个大规模MoE模型,总参数较Hy3增加了约1.6倍。腾讯同样进行了明显的规模扩张,只是没有完全沿着两万亿以上参数的路线继续向上堆叠。MoE模型每次推理只激活部分参数,实际推理成本与总参数量并不完全对应。训练数据质量、后训练、强化学习、注意力结构和推理系统优化,都在影响模型最终表现。

腾讯也明确表示,Hy4的进步来自模型规模、训练数据、预训练和后训练的共同提升。团队还与腾讯内部的软件工程师、游戏开发者、金融分析师和安全专家合作,把真实业务任务转化为训练和评测数据。这可能比单纯扩大参数更适合腾讯。

腾讯最需要的不是一款在所有排行榜上都领先的模型,而是一款能够稳定进入公司现有产品、完成真实任务,同时成本可以接受的模型。只要模型能力达到第一梯队,微信、游戏、广告和云的产品优势才有可能真正发挥出来。

02

腾讯的AI商业化并不是从零开始

腾讯已经通过AI获得了一部分回报,只是这些回报主要隐藏在原有业务中,而不是以独立的“AI收入”出现。

最先兑现的是广告。今年第二季度,腾讯营销服务收入达到436亿元,同比增长22%。腾讯在财报中表示,广告基础模型的升级提高了广告相关性、转化效果和定价能力,推动微信生态中的广告收入增长。大模型未必需要直接向用户收费。只要它能够提高广告点击率和转化率,即使每一次提升都很小,放到微信、视频号、小程序和公众号的庞大流量中,也可能形成可观的增量收入。

游戏是另一条间接商业化路径。Hy4的训练数据中包括腾讯内部游戏开发者提供的真实任务。模型可以参与代码编写、素材生成、角色设计、测试和运营,缩短游戏研发和内容生产周期。这部分价值短期内更多体现为效率提升,而不是新的收入科目。它很难被单独从游戏收入中拆分出来,但可能减少开发成本,提高内容更新速度,并延长成熟游戏的运营周期。

第二条商业化路径来自腾讯云。腾讯第二季度金融科技及企业服务收入达到603亿元,同比增长9%。该板块并不全部属于云业务,但腾讯明确表示,企业对AI相关服务的需求增加,带动了GPU租赁 、模型即服务以及WorkBuddy、CodeBuddy等产品的收入增长。

Hy4 preview已经接入WorkBuddy、CodeBuddy、元宝和ima,开发者也可以通过腾讯云TokenHub和OpenRouter调用。按照腾讯云公布的价格,Hy4 preview每百万Token输入价格为6元,输出价格为18元,缓存命中价格为0.3元。

这个价格低于部分同级旗舰模型,但明显高于Hy3。模型能力提高后,腾讯正在尝试获得更高的单次调用收入。

不过,API本身很难成为腾讯最重要的AI生意。

国内模型价格仍在快速下降,开源模型之间也可以相互替换。如果模型能力差距不大,开发者很容易根据价格和任务类型切换模型。腾讯云自己的TokenHub就同时提供DeepSeek、GLM、Kimi、Qwen和MiniMax等模型。腾讯在二季度材料中引用易观数据称,WorkBuddy和CodeBuddy在6月已经位居国内PC端AI生产力工具月度交互量第一。

第三条商业化路径来自C端产品,也是市场最关注的一条。腾讯已经在测试微信AI助手“小微”,元宝也在继续接入微信、QQ和腾讯其他内容生态。如果AI助手能够读取用户授权的信息,在聊天、搜索、支付、小程序和内容服务之间完成任务,微信可能成为Agent最适合落地的平台之一。

但入口并不自动等于产品,用户每天打开微信,并不意味着用户会每天使用微信里的AI助手。腾讯还需要找到足够高频、能够明显节省时间,同时不会破坏原有社交体验的使用场景。

03

Hy4开始形成腾讯自己的打法

第二季度,腾讯研发费用达到272亿元,同比增长35%;资本开支达到528亿元,同比增长176%。受资本开支增长等因素影响,公司自由现金流由去年同期的正430亿元转为负138亿元。

Hy4 preview发布后,同步进入WorkBuddy、CodeBuddy、元宝和ima。腾讯先发布preview版本,也是为了尽快获得真实用户反馈,再用于正式版的后训练。

随着后训练变得越来越重要,腾讯的产品场景开始成为混元的核心资源。Agent没有完成的任务、代码生成中的错误以及用户对结果的修改,都可以转化为训练数据、强化学习任务和评测集。

模型进入产品,产品产生反馈,反馈再推动下一代模型。这是腾讯反复强调模型与产品Co-Design的真正价值。

过去,腾讯的优势是场景多,短板是模型能力不足。Hy4进入第一梯队后,腾讯开始能够用产品反馈改进模型,再用更强的模型重新改造产品。

从2月重建底层基础设施,到8月推出Hy4 preview,混元已经把大版本迭代周期压缩到两个月左右。Hy4不只是一款追上第一梯队的模型,也可能是腾讯开始建立长期模型竞争力的起点。

(文章来源:新财富)

(来源:东方财富网 编辑:张明艳)