小米 MiMo-V2.6 深度评测:当前最强开源模型的全面解析

11 次浏览次阅读

小米 MiMo-V2.6 深度评测:当前最强开源模型的全面解析

2026 年 9 月 22 日,小米正式发布并开源了 MiMo-V2.6 系列模型,包含 Pro 和 Flash 两个版本。这是小米在递归自我改进(RSI)路径上的关键一步,通过规模化扩展强化学习算力,让模型在持续探索与反馈中拓展智能边界。本文将从架构设计、性能评测、应用场景、定价策略等多个维度,对 MiMo-V2.6 系列进行深度解析。


一、模型概览

特性 MiMo-V2.6-Pro MiMo-V2.6-Flash
定位 旗舰全模态模型 高效轻量模型
输入模态 文本、图像、视频、音频 文本、图像、视频、音频
输出模态 文本 文本
上下文长度 1M tokens 1M tokens
最大输出 128K tokens 128K tokens
许可证 MIT(开源商用) MIT(开源商用)
核心能力 全模态理解、深度思考、工具调用 全模态理解、深度思考、工具调用

MiMo-V2.6 系列是小米迄今最强大的全模态旗舰模型,支持图像、视频、音频、文本联合输入与理解,面向专业、长程、复杂工作流,并兼顾科学研究、网络安全等高阶能力。


二、架构与训练创新

2.1 混合注意力架构

MiMo-V2.6 采用混合注意力机制,以 1:7 的比例融合全局注意力(Global Attention)与滑动窗口注意力(Sliding Window Attention, SWA)。这种设计在保证对长上下文的全局理解能力的同时,大幅降低了计算开销。官方披露,滑动窗口大小为 128K,但效果优于 512K 的大窗口方案。

2.2 多 Token 预测(MTP)技术

推理加速环节引入了 MTP(Multi-Token Prediction)技术。该模块在推理时被复用为投机解码的草稿模型,通过增加计算算术强度来抵消显存带宽瓶颈。加载 3 层 MTP 模块后可实现 2-2.6 倍的实际推理加速比,相当于模型学会了 "抢答",能一次性草拟出后续多个词,主模型只需并行批改。

2.3 多教师在线策略蒸馏(MOPD)

训练流程采用了 MOPD(Multi-teacher Online Policy Distillation)新范式。通过构建特定领域的教师模型网络,利用反向 KL 散度为学生模型提供密集的 Token 级奖励信号,仅需传统 SFT+RL 流程约 1/50 的计算量即可达到同等效果。


三、性能评测:开源之巅

3.1 综合智能指数

MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数中取得 46.32 分 ,超过 Kimi K3 和 Qwen3.8 Max,成为当前全球最强开源模型。

但在与最强闭源模型的对比中,MiMo-V2.6-Pro 与 Claude Fable 5.1 和 GPT-6 Astra 相比仍有差距。这说明开源模型正在快速逼近闭源前沿,但尚未实现超越。

3.2 Benchmark 对比

Benchmark MiMo-V2.6-Pro Claude Opus 5 GPT-6 Astra DeepSeek V4
AA 综合智能指数 46.32 ~52 ~50 36.3
DeepSWE v1.1 72.6
Design Arena 与 Claude Opus 5 接近 领先 接近
SWE-Bench Verified 78+(Thinking) 77.8 73.1
输出速度 134.3 t/s 236.4 t/s

3.3 RL 训练成果

小米在 RL 训练阶段投入了国产开源模型中最多的算力之一:

  • 训练规模 :Pro 与 Flash 各完成 30 步 RL 训练,累计约 75 万条轨迹
  • 训练成本 :Pro 约 262 万美元,Flash 约 85 万美元
  • 训练时长 :不到 6 天完成全部训练
  • 性能提升 :任务平均通过率分别提升 25%(Pro)和 12%(Flash)
  • DeepSWE v1.1:Pro 从 58.4 提升至 72.6,Flash 从 48.8 提升至 65.7

训练采用 1,568 个样本的大 Batch,支持 1M 上下文,单步训练 Token 达 2.7-3.7B。这种大规模 RL 训练展示了模型在样本效率和泛化能力上的显著优势。


四、核心能力解析

4.1 3D 空间推理与多模态感知

MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作能力。用户可以输入图片、视频或文字,模型会自动拆解任务,通过多智能体协作完成 3D 场景搭建、交互逻辑与视觉验证,持续修正并生成可运行的交互世界。这意味着从 "Vibe Coding" 到 "Vibe World" 的跨越——模型不仅能写代码,还能构建完整的 3D 开放世界游戏。

4.2 代码与软件工程

代码能力是 MiMo 系列的标志性长板。MiMo-V2.6 在编程场景中表现出极高的完成度:

  • 在 SWE-Bench Verified 评测中,Thinking 模式下得分 78+
  • 在 MiMo Coding Bench 中超越 Claude Opus 4.6
  • 在以 "Hunter Alpha" 代号匿名上线 OpenRouter 期间,调用量连续多天登顶日榜

4.3 科研辅助能力

MiMo-V2.6-Pro 展现了强大的科研辅助潜力:

  • 材料科学 :协助小米专家设计 MOF 材料吸附 PFAS 污染物,自动检索文献、提出假设、模拟结合强度
  • 数学形式化 :在 Lean 4 中完成 Li-Yorke 定理的完整形式化,生成 6,000 余行源码并通过核心验证

4.4 内容创作

MiMo-V2.6 支持端到端高质量视频创作,包括视觉设计、镜头与动效编排、配乐合成与节奏对齐。在科普视频场景中,能将傅里叶分解、凸包等抽象概念转化为易懂的解释与连贯动画,并调用 MiMo-V2.5-TTS 合成配音。


五、定价与性价比

项目 MiMo-V2.6-Pro MiMo-V2.6-Flash
输入(缓存命中) $0.0036/ 百万 tokens $0.0005/ 百万 tokens
输入(缓存未命中) $0.435/ 百万 tokens $0.14/ 百万 tokens
输出 $0.87/ 百万 tokens $0.28/ 百万 tokens
上下文窗口 1.05M tokens 1.05M tokens

MiMo-V2.6-Pro 刷新了国产模型的性价比纪录:在同等智能水平下,价格仅为海外模型的 1/20 至 1/60

此外,MiMo-V2.6-Pro 还提供 UltraSpeed 超高速模式,输出速度最高可达普通 Pro 版本的 20 倍,适合对响应速度敏感的实时交互场景。


六、开源生态

小米全面开源了 MiMo-V2.6-Pro 和 Flash 的模型权重与技术报告,同步开放:

  • MiMo-V2.6-Distill-Qwen-9B:从 RL 轨迹中蒸馏的小型模型
  • 7,000+ 高质量 RL 任务环境 :覆盖代码、通用、视觉、网络安全等领域
  • 端到端 RL 训练框架 :经过验证的训练实践
  • 可组合 Mini-Harnesses:支持不同能力维度的协同提升

这意味着研究人员和开发者可以基于 MiMo-V2.6 的训练基础设施,构建自己的 Agent 系统,而不仅仅是使用模型权重。


七、与竞品对比

7.1 与 DeepSeek V4 对比

从综合智能指数来看,MiMo-V2.6-Pro(46.32)大幅领先 DeepSeek V4 Pro(36.3)。但在输出速度上,DeepSeek V4 Flash(236.4 t/s)显著快于 MiMo-V2.6-Pro(134.3 t/s)。价格方面,两者处于同一水平,但 MiMo-V2.6 在 Agent 和代码场景中的表现更为突出。

7.2 与 Claude 系列对比

MiMo-V2.6-Pro 在多数 Agent Benchmark 上取得了比肩 Claude Opus 5 的效果,但在综合智能上仍有约 6 分的差距。不过,MiMo-V2.6 的价格仅为 Claude 的 1/20-1/60,性价比优势明显。

7.3 与 GPT-6 Astra 对比

GPT-6 Astra 在综合智能上略高于 MiMo-V2.6-Pro,但两者差距已缩小到个位数。考虑到 MiMo-V2.6 是完全开源的(MIT 许可证),这种追赶速度令人印象深刻。


八、总结与展望

MiMo-V2.6 系列标志着小米在大模型领域的重要突破:

  1. 开源之巅 :成为当前全球最强开源模型,综合智能指数 46.32
  2. 全模态融合 :原生支持文本、图像、视频、音频联合理解
  3. Agent 能力 :在编程、科研、3D 推理等场景展现强大实力
  4. 极致性价比 :同等智能水平下价格仅为海外模型的 1/20-1/60
  5. 开源生态 :提供完整的训练框架和 RL 环境,赋能社区

小米的愿景很清晰:不仅要做一个强大的模型,更要做一个完整的开源 Agent 生态——从基座模型、编程 Agent、Harness 到强化学习环境和训练基础设施。MiMo-V2.6 是这个愿景的最新里程碑,也预示着开源模型与闭源前沿的差距正在加速缩小。


本文基于小米官方发布的技术报告、Artificial Analysis 评测数据、VentureBeat 报道等公开信息撰写。评测数据截至 2026 年 9 月,实际使用效果可能因场景而异。

正文完
 0
yxsoft
版权声明:本站原创文章,由 yxsoft 于2026-09-22发表,共计3499字。
转载说明:除特殊说明外本站文章皆由YXSoft发布,转载请注明出处。