小米MiMo团队首次公开新模型训练实况 强化学习规模边界挑战进行时

   发布时间:2026-09-17 12:36 作者:沈如风

小米MiMo团队负责人罗福莉近日在X平台发布动态,首次公开了MiMo-V2.6模型的强化学习训练进展。她透露,团队正通过扩大计算资源、训练环境与任务体系、奖励评估机制三个维度,探索强化学习(RL)的扩展边界。此次公开的实时训练页面,展示了模型在复杂任务场景下的能力提升过程。

训练页面显示,MiMo-V2.6分为Pro和Flash两个版本,当前分别处于第12步和第17步训练阶段。Pro版本累计消耗251亿Token,训练成本约80.6万美元;Flash版本则消耗405亿Token,成本约35.4万美元。尽管总成本已超116万美元,但团队更关注模型通过大规模任务交互实现的能力跃迁。例如,Pro版本的DeepSWE软件工程基准测试得分达63.72,Flash版本为60.77,同时两者的平均上下文长度均突破10万Token,为处理复杂任务提供基础支撑。

在计算规模扩展方面,团队将单个训练步的Token量提升至20亿,采用1568个提示词与16次并行探索的异步训练模式。这种设计使模型能同时尝试2.5万种解决方案,通过奖励反馈筛选最优路径。罗福莉解释,相较于传统大模型依赖预训练知识,强化学习通过海量试错帮助模型形成动态任务执行策略,这对编程、数据分析等需要多步骤决策的场景尤为重要。

训练环境的多样化是另一关键突破。团队引入多任务智能体强化学习框架,将视觉、代码、通用任务和聊天等场景混合训练。实时监控面板显示,当前训练数据涵盖GTA5、VS3E等视觉数据集,以及代码任务集和通用对话集。这种设计迫使模型适应不同领域的交互逻辑,而非单一能力优化。例如,在处理视觉任务时,模型需结合工具调用和结果验证,这与代码生成场景中的步骤规划形成能力互补。

奖励评估机制的革新则体现在更精细的反馈系统。团队采用智能体组内贡献归因方法,结合测试用例和评分细则分配奖励。面对多步骤任务,评判系统需区分不同执行轨迹的价值,引导模型学习高效策略。数据显示,Pro版本的平均奖励值从0.55提升至0.582,Flash版本从0.52升至0.570,两条曲线均呈波动上升趋势,印证了奖励机制的有效性。

此次公开训练过程而非最终成绩,标志着小米对AI研发透明度的提升。传统大模型公司通常仅在发布时披露参数和榜单数据,而MiMo团队选择展示计算投入、任务组成与能力变化的动态关系。随着训练持续推进,外界将能观察计算资源增长与模型效能提升的关联性,以及长上下文处理能力对复杂任务完成度的影响。这种开放姿态,或为AI研发社区提供新的方法论参考。

 
 
更多>同类内容
全站最新
热门内容