跳到正文
原文
InfoQ 中文· 褚杏娟·· 7 小时前精选AI 评分77

小米披露 MiMo-V2.6 规模化强化学习路线:单次 RL 后训练烧掉 260 万美元

单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线

AI 导读

小米 MiMo 团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,披露一套规模化 Agentic RL 训练过程,并发布 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个 MoE 模型。

推荐理由

小米公开了单步 37 亿 Token、后训练 260 万美元的规模化 Agentic RL 细节,可看到成本结构与工程故障的真实分布。

来源:InfoQ 中文 · infoq.cn