罗福莉押注大规模RL、小米最强开源模型亮相:6天烧掉2000多万,多个 Agent 基准比肩闭源旗舰

9月22日,小米MiMo团队对外发布并开源了MiMo-V2.6系列,包含旗舰型号MiMo-V2.6-Pro以及侧重效率与成本的MiMo-V2.6-Flash。此外,小米还推出了针对低延迟场景的MiMo-V2.6-Pro-UltraSpeed,据官方说法,该版本在维持相同模型质量的前提下,输出速度最高可达标准Pro版模型的20倍。

小米新发布的旗舰系列模型

与单纯扩大模型参数不同,MiMo-V2.6此次将重点放在了强化学习阶段的计算扩展上。小米将其描述为对RSI(递归自我改进)路径的一次探索:在编程、通用智能体、视觉任务和网络安全等具备可验证结果的复杂环境中增加强化学习投入,让模型通过持续的探索、环境反馈和结果评估来提升任务完成能力。

不过,根据目前公开的信息,MiMo-V2.6所展现的“自我改进”主要发生在由训练系统、任务环境和评估器构成的强化学习闭环中,这并不意味着模型已能脱离人类设计的训练框架,自主修改自身结构或启动下一轮训练。

据介绍,MiMo-V2.6-Pro和MiMo-V2.6-Flash均采用稀疏混合专家架构,原生支持文本、图像、视频和音频输入,最大上下文窗口为100万Token。

其中,MiMo-V2.6-Pro拥有1.02万亿总参数,每次推理激活约420亿参数;MiMo-V2.6-Flash总参数为3090亿,激活参数约为150亿。两款模型使用相同的视觉和音频编码器,并配置了五层多Token预测模块,用于推测式解码。

从定位来看,Pro面向复杂编程、长程智能体和研究任务,而Flash则试图以更少的激活参数来降低推理成本。两款模型的权重已在Hugging Face上以MIT许可证发布。

MiMo-V2.6系列还包含一款由Qwen架构蒸馏而来的90亿参数模型,但小米此次的主要产品仍是Pro和Flash两个版本。Hugging Face的模型集合目前共收录了三款MiMo-V2.6模型。

模型发布后,小米大模型负责人、前DeepSeek研究员罗福莉在X上发帖,将MiMo-V2.6的研发过程概括为“一条艰难的强化学习扩展之路”。

她表示,按计算投入来衡量,MiMo-V2.6“很可能是迄今为止开源模型团队开展的最大规模单次强化学习训练之一”。在算力资源仍然非常紧张的情况下,小米依然选择投入数十人的团队,集中完成这次大规模RL训练。

Benchmark表现如何?

那么,这系列模型的基准测试表现如何?

根据小米公布的测试结果,MiMo-V2.6-Pro在DeepSWE v1.1上取得了71.9分,明显高于上一代MiMo-V2.5-Pro的19分;Flash为67.9分。在Terminal Bench 2.1上,两款模型分别为89.9分和87.6分。

在通用智能体测试中,Pro在AutomationBench v1.0.6上获得了53.1分,高于对比表中的Claude Opus 5、GPT-5.6 Sol和Claude Fable 5;Flash为52.3分。在OSWorld-Verified上,两款模型分别取得了82分和80.8分。

但这些结果也显示,MiMo-V2.6并未在所有项目上领先。Pro在ProgramBench上取得了26.5分,低于Claude Opus 5的37分;Terminal Bench 4.0得分为34.9,低于Claude Opus 5的49分。在Toolathlon-Verified、GDPval-AA 2.1等测试中,Pro也不是得分最高的模型。

小米还引用Artificial Analysis Intelligence Index v4.3的结果称,MiMo-V2.6-Pro得分为46.32,并将其描述为当前得分最高的开源模型。

此次发布,MiMo-V2.6值得关注的一个点是,小米开始尝试将编程能力扩展到更广泛的生产任务。

基准测试结果看起来很强大,实际应用效果如何?小米提供给了我们几组官方案例。

在官方展示的案例中,模型可以根据文本、图片或视频描述,将游戏开发任务拆解给多个智能体,分别完成3D场景构建、交互逻辑编写和视觉验证,并根据渲染结果反复修改。小米将这种由自然语言驱动、从软件开发延伸至交互式世界构建的方式称为“Vibe World”。

在3D建模场景中,模型可以控制Blender,根据文字或参考图片生成物体和场景;再比如在具身仿真环境中,模型可以读取多路摄像头画面,通过视觉反馈控制Franka Panda机械臂,完成抓取、颜色匹配和物体放置。

MiMo-V2.6还展示了前端页面、演示文稿、视频剪辑和音乐创作能力。

例如,MiMo-V2.6可提供端到端的高质量视频创作服务。对于创意和产品宣传视频,它可以根据用户需求处理视觉设计、镜头和动态序列、音乐创作以及节拍同步剪辑。对于教育视频,它可以将傅里叶分解等抽象概念转化为通俗易懂的解释和连贯的动画,并利用MiMo-V2.5-TTS生成与画面精准同步的旁白。这实现了从概念分解到最终视频输出的全流程自动化,将复杂的知识转化为观众易于理解的生动内容。

这些案例反映出MiMo-V2.6的目标不只是生成代码,而是让代码、视觉理解、工具调用和计算机操作共同服务于一个完整任务。

此外,小米还公布了两个科研案例。

第一个案例涉及材料研究。小米材料专家要求MiMo-V2.6-Pro设计一种能够吸附全氟和多氟烷基物质的金属有机框架材料。模型完成了文献及专利检索、假设提出、创新性分析,并调用开源计算工具开展模拟,计算不同材料与目标物质之间的结合强度,筛选进入湿实验阶段的候选结构。

第二个案例是形式化数学证明。在研究人员设计的探索策略和多智能体协作流程下,MiMo-V2.6-Pro参与完成了经典论文《周期三意味着混沌》主要定理的Lean 4形式化。最终项目包含超过6000行Lean代码,并通过Lean内核验证,没有保留未完成的证明占位符。

但需要注意的是,这些工作均不是模型独立完成:材料案例由专业人员经过多轮提示和筛选推进,数学案例同样依赖研究人员设计探索策略,并进行了后续修订与整合。因此,从这个角度来看,它们更能说明模型作为科研辅助工具的潜力,而不是证明模型已经具备自主开展科研的能力。

6天完成约150万条轨迹,强化学习成本超过340万美元

MiMo-V2.6最值得关注的变化并不是参数规模,而是强化学习训练方式。

有意思的是,在正式发布MiMo-V2.6之前,小米MiMo团队曾将这轮强化学习的生产训练过程公开直播,对外展示两款模型的训练进度、任务得分和资源消耗。

与发布模型后再披露结果不同,这次直播把一场持续近6天的大规模RL训练直接摆到外界面前:模型是否持续提升、训练中途是否出现波动,以及算力投入能否换来能力增长,都可以从实时曲线中观察。如今随着模型与技术报告发布,这场直播背后的训练规模和技术细节也进一步浮出水面。

小米披露,MiMo-V2.6-Pro和MiMo-V2.6-Flash分别在不到6天的时间内完成了30个强化学习步骤,每款模型处理约75万条轨迹。

Flash的训练成本约为85万美元,Pro约为262万美元,合计约347万美元。

其单步训练批次包含1568个提示,每个提示生成16条轨迹,单步处理约35亿至37亿Token,训练上下文最高达到100万Token。

与分别针对编程、视觉或智能体进行独立强化学习不同,小米将编程、通用智能体、视觉和网络安全任务混合在同一轮训练中,希望不同任务中形成的策略能够互相迁移。

在奖励环节,MiMo团队没有仅使用“通过或失败”的二元信号,而是引入了组内比较机制:评估智能体对同一道任务产生的多条轨迹进行横向比较,为已经完成任务的方案进一步区分质量,并将更高奖励分配给路径更短、Token消耗更少或执行质量更高的结果。

这套方法的直接目的,是解决长程智能体训练中的一个问题:两条轨迹可能都通过测试,但它们在执行效率、步骤合理性和稳定性方面存在明显差异,仅靠最终测试结果无法体现这种差别。

为了控制奖励作弊,小米称其在训练中加入了环境加固、异常检测、对抗性评估及不同验证器之间的交叉检查,并冻结了MoE模型的路由器,以减少大规模强化学习过程中专家选择策略发生漂移。

按照官方公布的训练曲线,经过30步强化学习后,Flash和Pro在训练任务上的平均通过率分别相对提高了约25%和12%。

在未直接用于训练的长程软件工程测试DeepSWE v1.1上,两款模型分别从48.8分和58.4分提升到65.68分和72.57分。

小米据此认为,强化学习带来的提升能够部分迁移到训练分布之外。

小米同时开放了技术报告、训练环境和强化学习代码。相比只发布最终权重,这使外界有机会进一步检查其任务设置、奖励设计与训练过程,但相关结果能否被独立复现,仍有待开发者和研究机构后续验证。

MiMo-V2.6提升如此快,技术上如何实现的?

从技术报告看,MiMo-V2.6的性能并不是由某个单点创新带来的,而是模型架构、预训练、中期训练、强化学习规模、奖励设计和训练基础设施共同作用的结果。

其中最关键的变化,是小米不再只把计算资源用于增加预训练数据和模型参数,而是将大量算力投入模型与真实任务环境的交互,让模型在一次次执行、验证和纠错中学习如何完成长程任务。

简单来说,MiMo-V2.6的路线可以概括为:先用大规模预训练建立知识和多模态理解能力,再通过面向智能体的中期训练扩展模型的“探索空间”,最后在可验证的复杂任务上大规模生成轨迹,利用更精细的奖励机制筛选出更好的解决路径。

第一层:混合注意力与稀疏MoE兼顾规模和长上下文

MiMo-V2.6-Pro采用稀疏混合专家架构,总参数为1.02万亿,每次推理激活约420亿参数。

Flash总参数约3100亿,激活约150亿参数。两款模型每层只激活8个专家,由此在扩大模型容量的同时,避免让全部参数参与每一次计算。

模型主干采用“滑动窗口注意力+全局注意力”交替排列的混合架构。滑动窗口注意力只处理附近Token,将计算开销控制在较低水平;周期性插入的全局注意力,则负责重新汇总长距离信息。

这种设计针对的是长程智能体任务中的现实矛盾:模型需要读取代码库、工具返回结果、历史操作和多轮上下文,但如果每一层都对全部Token执行全局注意力,100万Token上下文的计算和显存成本会非常高。

MiMo-V2.6-Pro共包含70层,其中60层使用滑动窗口注意力,10层使用全局注意力;Flash共48层,其中39层为滑动窗口注意力、9层为全局注意力。其滑动窗口大小为128个Token。

这使模型可以用大量局部计算处理细节,再由少数全局注意力层完成跨区域信息交换。它并不会消除长上下文的计算成本,但相比全程使用全局注意力,更适合处理代码仓库和长时间智能体轨迹。

视觉编码器也采用了类似思路。MiMo-ViT在局部滑动窗口层中交替使用行优先和列优先的Token排列,让视觉信息能够分别沿水平和垂直方向传播,再通过周期性的全局注意力聚合完整画面。官方称,该视觉编码器使用超过4万亿个图像Token预训练。

音频部分则先把音频转换成离散Token,再把连续四帧合并成一个音频Patch,将输入主模型的音频序列频率从每秒25个降至6.25个,以缩短序列长度。

因此,所谓“原生全模态”并不是简单地把多个独立模型串联起来,而是将文字、图像、视频和音频编码为统一序列,交给同一套语言模型主干处理。MiMo-V2.6的模型卡显示,两款模型均支持四种模态及100万Token上下文。

第二层:预训练之后,先进行一次面向智能体的“中期训练”

技术报告披露,MiMo-V2.6采用两阶段预训练。

第一阶段只训练语言模型主干,数据包括公开网页、书籍、学术论文、代码和STEM材料;第二阶段接入视觉与音频编码器,在图文、OCR、GUI、视频、视觉编程、语音识别和音频描述等数据上联合训练。

MiMo-V2.6-Flash的预训练数据量为48万亿Token,其中纯文本阶段26万亿Token,全模态阶段22万亿Token;Pro共训练30万亿Token,其中270亿——更准确地说是27万亿——来自文本阶段,3万亿来自全模态阶段。

预训练时,模型上下文窗口从3.2万Token逐步扩展到25.6万Token。此后,小米的做法是增加了一个面向智能体的中期训练阶段。

这一阶段的数据不仅包括高质量文本、代码、图像和音视频,也包括编程、通用智能体、视觉与科研场景中的真实任务轨迹。模型先在25.6万Token上下文上训练,最后再扩展至100万Token。

技术报告对这一步的解释是:预训练提供知识,中期训练则在预训练与大规模强化学习之间建立桥梁,让模型提前接触“观察环境—调用工具—读取结果—继续行动”的任务形式。

如果没有这一阶段,模型虽然可能掌握大量知识,却未必能够在强化学习开始时有效探索。大量轨迹可能消耗在格式错误、工具调用失败或者无法维持长程上下文等基础问题上。

小米还在中期训练阶段将部分参数的优化器从AdamW切换到Muown。传统AdamW按参数元素调整更新幅度;Muown则利用权重矩阵的结构,对更新矩阵进行正交化处理。小米认为,在超大批次训练中,这种方式能够维持更好的数据效率。

模型同时接受MXFP4量化感知训练,使其在训练期间提前适应低精度计算,为后续FP4推理减少质量损失。

第三层:一次强化学习生成2.5万条轨迹

MiMo-V2.6性能提升最直接的来源,是强化学习规模的大幅扩张。

小米在每个强化学习步骤中抽取1568个任务,每个任务生成16种候选解法,也就是一次产生约2.5万条智能体轨迹。这些轨迹合计包含27亿至37亿个训练Token,平均每条约11万至15万个Token。

这和普通问答式强化学习存在明显区别。MiMo-V2.6面对的不是一道题、一段回答,而是持续数十步甚至更长的智能体任务。一条轨迹可能包括:

  • 阅读代码仓库;
  • 检索相关文件;
  • 修改代码;
  • 运行测试;
  • 根据报错继续修改;
  • 调用外部工具;
  • 最终提交结果。

MiMo-V2.6-Pro和Flash均完成30个强化学习步骤,分别处理约75万条轨迹。Pro的强化学习成本约为260万美元,Flash约为90万美元。

在Pro的强化学习支出中,约43.8%用于模型生成轨迹,43.5%用于参数训练,还有12.7%用于评估器。换句话说,小米投入的计算资源不只是让模型“多做题”,还用于判断不同答案究竟好在哪里。

根据报告,在这轮强化学习中,Pro在DeepSWE v1.1上的平均成绩由58.4分提升至72.6分,Flash由48.7分提升至65.7分。性能随着累计强化学习投入总体上升,但训练过程中也存在波动。

这组数据支持“增加RL计算可以继续释放模型潜力”的判断,但还不能证明性能会随投入无限增长。报告只展示了30步训练范围内的变化,没有给出继续扩大至数倍计算量后的收益曲线。

第四层:不再只判断“做对没有”,还要判断“做得好不好”

传统代码强化学习经常使用二元奖励:测试通过记为1,失败记为0。

这种方式容易规模化,但存在一个问题:两份代码都通过了测试,不代表它们的质量相同。一份可能只修改必要代码,另一份可能加入大量无关逻辑;一份真正定位了问题,另一份可能通过硬编码或利用测试漏洞获得正确结果。

MiMo-V2.6引入了两套组内智能体评估机制。

第一套是Groupwise Reward Synthesis,即组内奖励合成。小米先针对同一任务生成多种解决方案,让评估智能体比较这些方案,并建立两类评分标准:

  • 解决方案标准:是否完整满足需求、是否覆盖边界情况、代码修改是否符合原有项目结构;
  • 行为标准:模型是否收集了必要证据、是否检查代码改动、是否验证最终结果。

训练时,测试结果、解决方案质量和执行行为三部分相乘。未通过测试的轨迹仍然得不到奖励;通过测试的轨迹则根据实现质量进一步区分。

第二套是Groupwise Advantage Redistribution,即组内优势重分配。对于同一任务产生的16条轨迹,评估器会把成功和失败方案放在一起比较,并从解决思路、实现完整性、修改范围、副作用和代码规范等维度对通过测试的方案排序。

随后,训练系统会从质量较低的正确答案中移走一部分正向奖励,重新分配给质量更高的方案。

它解决的不是“模型能否得到正确答案”,而是“模型能否用更稳定、更简洁、更符合工程规范的方式得到答案”。技术报告显示,加入在线组内评估后,模型在DeepSWE上的通过率能够继续增长;缺少这套机制时,后期提升更容易趋于停滞。

第五层:同时训练多个领域和多套Agent框架

MiMo-V2.6没有为代码、视觉和工具调用分别执行独立强化学习,而是在同一次训练中混合多类任务。

其强化学习数据大致由以下部分构成:

  • 智能体编程和竞技编程:68%;
  • 通用工具调用:12%;
  • 视觉与审美设计:13%;
  • 上下文遵循:3%;
  • 网络安全:4%。

代码任务又同时运行在多种Agent Harness上。Harness可以理解为包裹模型的执行框架,它决定模型能使用哪些工具、如何获得上下文、怎样编辑文件以及如何提交结果。

如果训练始终使用同一套框架,模型可能学会适应该框架的提示词和工具习惯,却无法迁移至其他Agent产品。为减少这类过拟合,小米在训练中使用四套轻量级Harness,并在Codex、Claude Code和mini-swe-agent三套未参加训练的Harness上测试。

报告显示,三套留出框架的DeepSWE平均Pass@1从约50%提高到66%,说明模型学到的部分能力能够跨Harness迁移,而不只是记住某一种执行流程。

这也是多任务强化学习的一个重要作用:模型需要学习更通用的任务分解、工具选择和错误恢复策略,而不是依赖固定的提示模板。

第六层:冻结MoE路由器,避免专家系统在强化学习中失衡

大规模MoE模型进行强化学习时,还会遇到一个容易被忽视的问题:专家负载可能逐渐失衡。

如果路由器继续参与训练,模型可能越来越频繁地把Token分给少数专家,导致部分

在采用256位SSL加密技术,保障用户交易与个人信息安全。方面,半岛体育网址提供贴心周到的支持。