小米 MiMo-VL-Miloco 技术报告
计算机视觉与模式识别
2025-12-23 v2
摘要
我们开源了 MiMo-VL-Miloco-7B 及其量化变体 MiMo-VL-Miloco-7B-GGUF,这是一对面向家庭场景的视觉语言模型,在家庭场景理解和通用多模态推理方面均表现出色。基于 MiMo-VL-7B 骨干网络,MiMo-VL-Miloco-7B 专门针对智能家居环境进行了优化,在手势识别和常见家庭场景理解方面取得了领先的 F1 分数,同时在 Video-MME、Video-MMMU 和 Charades-STA 等视频基准以及 MMMU-Pro 和 MMLU-Pro 等语言理解基准上也实现了稳定的提升。在我们的实验中,MiMo-VL-Miloco-7B 在家庭场景理解和多项多模态推理基准上优于强大的闭源和开源基线。为平衡专精性与通用性,我们设计了一个两阶段训练流程,将监督微调与基于组相对策略优化的强化学习相结合,并利用高效的多领域数据。我们进一步引入了思维链监督和基于令牌预算的推理,使模型能够以高效的数据方式学习知识,同时高效地进行推理。我们的分析表明,针对性的家庭场景训练不仅增强了活动和手势理解,还改善了纯文本推理,而在文档中心任务上仅有适度的权衡。模型检查点、量化 GGUF 权重和家庭场景评估工具包已公开发布于 https://github.com/XiaoMi/xiaomi-mimo-vl-miloco,以支持真实智能家居应用的研究与部署。
引用
@article{arxiv.2512.17436,
title = {Xiaomi MiMo-VL-Miloco Technical Report},
author = {Jiaze Li and Jingyang Chen and Yuxun Qu and Shijie Xu and Zhenru Lin and Junyou Zhu and Boshen Xu and Wenhui Tan and Pei Fu and Jianzhong Ju and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2512.17436},
year = {2025}
}