每小时“烧掉”超20万元!小米罗福莉直播展示大模型训练过程
来源:商学院杂志
雷军宣布,未来3年在AI领域投入600亿元,预计2026年全年研发投入超400亿元。
01
每小时成本20万元
沉寂半年后,小米罗福莉再次卷入大模型“厮杀”战场,并全程直播大模型训练过程。
9月17日凌晨,小米MiMo大模型团队负责人、DeepSeek前研究员罗福莉在X平台发文表示,目前正在研究强化学习(RL)能走多远。
罗福莉分享了MiMo-V2.6的实时训练页面,这也是外界首次看到这一代模型强化学习阶段的部分训练状态。
从罗福莉公开的训练页面来看,MiMo-V2.6正在进行一次大规模Agent强化学习实验。页面展示模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化,目前训练页面中包含两个版本,分别是MiMo-V2.6-Pro和MiMo-V2.6-Flash。
据统计,两个版本当前累计训练成本已经超过128万美元,其中MiMo-V2.6-Pro训练时长为1天19小时,耗费89万美元,平均每小时耗费超2万美元;MiMo-V2.6-Flash训练时长1天14小时,耗费39.7万美元,平均每小时耗费超1万美元。
综合计算,两个版本训练合计每小时花费约3.1万美元,折合人民币超20万元。
据罗福莉透露,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行三方面的扩展:一是计算资源(每步约20亿个Token,1568个Prompt×16次Rollout,完全异步);二是环境和测试框架(多任务智能体强化学习,一次运行中混合多个框架);三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。小米MiMo团队将在接下来的几周内逐步开源相关细节。
02
AI已成为小米投入力度最大的领域之一
MiMo是小米公司2026年3月正式推出的自研大模型系列,由DeepSeek前核心技术人才罗福莉带队研发。
在罗福莉的统筹下,小米MiMo大模型完成多代快速迭代,今年3月正式推出MiMo-V2-Pro、MiMo-V2-Omni、MiMo-V2-TTS三大基础模型,后续迭代升级出V2.5进阶版本,补齐高性能推理、轻量化通用交互、语音合成等全场景能力,成为小米大模型阵列中面向商用普惠市场的主力产品。
雷军此前曾多次提到小米在AI方面的进展。今年3月,雷军在微博发文称,万亿参数大模型Mimo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上,位列全球第八。按大模型品牌来排名,排在全球第五,超过了xAI Grok,此后还会快速迭代增强。
5月27日,小米技术发布公告,宣布对其自研大模型MiMo-V2.5系列API实施永久降价,最高降幅达99%,同时全面优化计费体系。这也是继DeepSeek之后,又一家宣布API永久降价的大模型公司。
据小米集团一季度业绩,公司总收入991.42亿元,同比下滑10.9%,环比下滑15.2%;经调整净利润60.72亿元,同比下滑43.1%,环比下滑4.4%。其中,小米手机×AIoT(人工智能物联网)分部收入793亿元,毛利率为22.5%;智能电动汽车及AI(人工智能)等创新业务分部收入199亿元。当季新车交付80856辆;研发投入90亿元,同比增长33.4%。
AI已成为小米投入力度最大的领域之一,公司表示,今年AI领域至少投入160亿元。与此同时,雷军宣布,未来3年在AI领域投入600亿元,预计2026年全年研发投入超400亿元。
03
AGI进程中最关键的一件事是“自进化”
罗福莉是雷军从DeepSeek挖来的“95后”AI领军科学家。
公开资料显示,罗福莉本科毕业于北京师范大学计算机专业,硕士阶段进入北京大学计算语言学深造。硕士毕业后,罗福莉加入阿里巴巴达摩院,担任机器智能实验室研究员,负责开发多语言预训练模型VECO,并推动AliceMind项目的开源工作。
2022年,罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作,后又担任DeepSeek的深度学习研究员,参与研发DeepSeek-V2等模型。
去年11月12日,罗福莉在朋友圈发文:“智能终将从语言迈向物理世界。我正在Xiaomi MiMo,和一群富有创造力、才华横溢且真诚热爱的研究员,致力于构建这样的未来,全力奔赴我们心目中的AGI。”这也是罗福莉首次正式宣布,自己已经加入小米,亦是对此前传言的回应。
今年3月,罗福莉与月之暗面创始人兼CEO杨植麟、智谱华章CEO张鹏等AI顶流们参加了一场圆桌论坛,谈起当时火热的OpenClaw(龙虾),罗福莉将其当做一种AI框架的革命性与颠覆性事件看待,并且因为是开源,有利于整个社区参与深度改进。“另外从技术角度来说,它保证了模型下限,同时又拉升了上限,在绝大部分场景,它的任务完成度已经非常接近Claude最新模型。”
罗福莉还表示,在接下来一年里,AGI进程中最关键的一件事是“自进化”。她认为,借助强大的模型与Agent框架,在可验证的约束条件下让模型持续迭代优化,模型便能自主学习和进化,拿出更优方案。
她预测,未来1—2年内,大模型叠加自进化框架,将对科学研究带来指数级加速,这并不仅仅是替代人力,而是让AI像顶尖科学家一样探索未知。
来源 | 《商学院》杂志综合自界面新闻、澎湃新闻、每日经济新闻、红星新闻
(来源:商学院杂志 编辑:张伟贤)


