一份榜单,一句坦白
9 月 22 日,小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。小米官方将这次发布定位为探索 RSI(递归自我改进)路径的关键一步,核心思路是规模化扩展强化学习算力,让模型在持续探索与反馈中拓展能力边界。
成绩方面,MiMo-V2.6-Pro 在独立评测机构 Artificial Analysis 的综合智能指数中取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前得分最高的开源模型。
小米在发布中也给出了一句坦白:与 Claude Fable 5.1、GPT-6 Astra 等闭源旗舰相比,MiMo-V2.6 仍有差距。小米选择在价格上补足这段距离。V2.6 的定价沿用 V2.5 系列,小米称在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。
六天,三百四十七万美元
这次发布之所以格外受关注,是因为发榜之前,小米先把训练过程直播了出来。
自 4 月开源 MiMo-V2.5 之后,小米在大模型领域沉默了近半年。9 月 17 日凌晨,MiMo 团队负责人、前 DeepSeek 研究员罗福莉在 X 平台发文,解释团队这半年只研究了一个问题:强化学习到底能扩展到多远。她同时公开了 MiMo-V2.6 的实时训练页面,外界可以直接看到训练进度、Token 消耗、训练成本和部分评测指标。
直播期间,页面上的成本数字一路跳动。据公开看板数据,Pro 与 Flash 两个版本合计每小时花费约 3.1 万美元,折合人民币超过 20 万元。训练中出现的问题也没有被隐藏:Pro 版本因节点显存问题重启过一次,Flash 版本因数据集错误从第 15 步重新开始,这些失败记录都留在了页面上。
最终结果在今天揭晓。Pro 与 Flash 的强化学习训练历时不到 6 天,成本分别约为 262 万美元和 85 万美元,两个版本各完成 30 步训练,累计生成约 75 万条轨迹。训练任务的平均通过率分别提升 25% 和 12%。在长程软件工程评测 DeepSWE v1.1 上,Pro 的得分从 58.4 提升到 72.57,Flash 从 48.8 提升到 65.68。
国内大模型厂商通常对后训练细节高度保密,公开直播训练在国内 AI 圈尚属首次。
从写代码到操控机械臂
能力层面,MiMo-V2.6 把 3D 空间推理、多模态感知与计算机操作能力融合到了同一个模型里。
据小米展示,模型可以根据自然语言描述生成 3D 开放世界游戏,在 Blender 中完成建模,还能控制机械臂完成抓取任务。在科研场景中,模型协助完成了 MOF 材料的设计筛选,并在 Lean 4 中完成了 Li-Yorke 定理的完整形式化证明,源码超过 6000 行。在设计能力评测 Design Arena 上,MiMo-V2.6-Pro 的表现与 Claude Opus 5、GPT-5.6 Sol 处于相近水平。
产品端同步推进。MiMo Desktop 桌面客户端与会员订阅方案随新模型一起上线,订阅会员可直接使用 Pro 与 Flash 模型,也可以配置自己的 API Key。客户端还为 Pro 提供了 UltraSpeed 超高速模式,最高可达 20 倍输出速度。
权重之外,训练环境也一并开源
这次开源的范围比常规发布更大。小米公开了 Pro、Flash 两个模型的权重和技术报告,同时开放了蒸馏模型 MiMo-V2.6-Distill-Qwen-9B、7000 多个高质量强化学习任务环境,以及端到端的强化学习训练框架。
对于中小团队和研究者来说,后者的价值可能不低于模型本身。强化学习的难点从来不只是算力,还在于任务环境怎么搭、奖励怎么设计。小米把这部分工具一起放出来,相当于把一套可复现的训练方法交到了社区手里。
热闹背后的冷问题
直播训练在社交网络上引发了大量讨论,评价也明显分成两派。支持者认为小米降低了行业的信息不对称,让外界第一次看清前沿强化学习的真实规模与成本;质疑者则认为这更像一场营销,烧钱的场面未必等于实际产出。
更现实的考验在后面。据 36 氪此前报道,小米已调整小爱同学的组织架构,由 MiMo 团队提供基础模型能力,手机、汽车等业务团队负责各自的端侧落地。这意味着 MiMo 的成绩最终要放进小米的设备生态里检验。编程评测的高分,并不等于用户在手机、汽车和智能家居里交代任务时能够完全放心。
开源第一的位置也并不稳固。国内开源模型的迭代周期正在以周计算,MiMo-V2.6 今天登上的位置,随时可能被下一个发布刷新。对小米而言,这次直播证明了它有能力把强化学习的规模做上去;接下来需要证明的,是这些能力能否真正变成用户每天用得上的产品。