InfoQ 中文· 褚杏娟·· 7 小时前精选AI 评分77
小米披露 MiMo-V2.6 规模化强化学习路线:单次 RL 后训练烧掉 260 万美元
单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线
AI 导读
小米 MiMo 团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,披露一套规模化 Agentic RL 训练过程,并发布 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个 MoE 模型。
推荐理由
小米公开了单步 37 亿 Token、后训练 260 万美元的规模化 Agentic RL 细节,可看到成本结构与工程故障的真实分布。
来源:InfoQ 中文 · infoq.cn