MiMo-Audio:音频语言模型是少样本学习器
计算与语言
2026-01-01 v1 声音
音频与语音处理
摘要
现有的音频语言模型通常依赖特定任务的微调来完成特定的音频任务。相比之下,人类仅需少量示例或简单指令即可泛化至新的音频任务。GPT-3 表明,扩展下一词元预测预训练能在文本中实现强大的泛化能力,我们相信这一范式同样适用于音频领域。通过将 MiMo-Audio 的预训练数据扩展至超过一亿小时,我们观察到其在多种音频任务上涌现出少样本学习能力。我们开发了针对这些能力的系统性评估,发现 MiMo-Audio-7B-Base 在开源模型中的语音智能与音频理解基准上均达到了 SOTA 性能。除标准指标外,MiMo-Audio-7B-Base 还能泛化至其训练数据中不存在的任务,如语音转换、风格迁移与语音编辑。MiMo-Audio-7B-Base 还展示了强大的语音续接能力,能够生成高度逼真的脱口秀、朗诵、直播与辩论。在后训练阶段,我们精心整理了多样化的指令微调语料库,并将思考机制引入音频理解与生成。MiMo-Audio-7B-Instruct 在音频理解基准(MMSU、MMAU、MMAR、MMAU-Pro)、口语对话基准(Big Bench Audio、MultiChallenge Audio)与指令 TTS 评估上取得了开源 SOTA,接近或超越了闭源模型。模型检查点与完整评估套件可在 https://github.com/XiaomiMiMo/MiMo-Audio 获取。
引用
@article{arxiv.2512.23808,
title = {MiMo-Audio: Audio Language Models are Few-Shot Learners},
author = {Core Team and Dong Zhang and Gang Wang and Jinlong Xue and Kai Fang and Liang Zhao and Rui Ma and Shuhuai Ren and Shuo Liu and Tao Guo and Weiji Zhuang and Xin Zhang and Xingchen Song and Yihan Yan and Yongzhe He and Cici and Bowen Shen and Chengxuan Zhu and Chong Ma and Chun Chen and Heyu Chen and Jiawei Li and Lei Li and Menghang Zhu and Peidian Li and Qiying Wang and Sirui Deng and Weimin Xiong and Wenshan Huang and Wenyu Yang and Yilin Jiang and Yixin Yang and Yuanyuan Tian and Yue Ma and Yue Yu and Zihan Zhang and Zihao Yue and Bangjun Xiao and Bingquan Xia and Bofei Gao and Bowen Ye and Can Cai and Chang Liu and Chenhong He and Chunan Li and Dawei Zhu and Duo Zhang and Fengyuan Shi and Guoan Wang and Hailin Zhang and Hanglong Lv and Hanyu Li and Hao Tian and Heng Qu and Hongshen Xu and Houbin Zhang and Huaqiu Liu and Jiangshan Duo and Jianguang Zuo and Jianyu Wei and Jiebao Xiao and Jinhao Dong and Jun Shi and Junhao Hu and Kainan Bao and Kang Zhou and Linghao Zhang and Meng Chen and Nuo Chen and Peng Zhang and Qianli Chen and Qiantong Wang and Rang Li and Shaohui Liu and Shengfan Wang and Shicheng Li and Shihua Yu and Shijie Cao and Shimao Chen and Shuhao Gu and Weikun Wang and Wenhan Ma and Xiangwei Deng and Xing Yong and Xing Zhang and Xu Wang and Yifan Song and Yihao Zhao and Yingbo Zhao and Yizhao Gao and Yu Cheng and Yu Tu and Yudong Wang and Zhaojun Huang and Zhengju Tang and Zhenru Lin and Zhichao Song and Zhipeng Xu and Zhixian Zheng and Zihan Jiang},
journal= {arXiv preprint arXiv:2512.23808},
year = {2026}
}