English

MiMo-Audio: Audio Language Models are Few-Shot Learners

Computation and Language 2026-01-01 v1 Sound Audio and Speech Processing

Abstract

Existing audio language models typically rely on task-specific fine-tuning to accomplish particular audio tasks. In contrast, humans are able to generalize to new audio tasks with only a few examples or simple instructions. GPT-3 has shown that scaling next-token prediction pretraining enables strong generalization capabilities in text, and we believe this paradigm is equally applicable to the audio domain. By scaling MiMo-Audio's pretraining data to over one hundred million of hours, we observe the emergence of few-shot learning capabilities across a diverse set of audio tasks. We develop a systematic evaluation of these capabilities and find that MiMo-Audio-7B-Base achieves SOTA performance on both speech intelligence and audio understanding benchmarks among open-source models. Beyond standard metrics, MiMo-Audio-7B-Base generalizes to tasks absent from its training data, such as voice conversion, style transfer, and speech editing. MiMo-Audio-7B-Base also demonstrates powerful speech continuation capabilities, capable of generating highly realistic talk shows, recitations, livestreaming and debates. At the post-training stage, we curate a diverse instruction-tuning corpus and introduce thinking mechanisms into both audio understanding and generation. MiMo-Audio-7B-Instruct achieves open-source SOTA on audio understanding benchmarks (MMSU, MMAU, MMAR, MMAU-Pro), spoken dialogue benchmarks (Big Bench Audio, MultiChallenge Audio) and instruct-TTS evaluations, approaching or surpassing closed-source models. Model checkpoints and full evaluation suite are available at https://github.com/XiaomiMiMo/MiMo-Audio.

Keywords

Cite

@article{arxiv.2512.23808,
  title  = {MiMo-Audio: Audio Language Models are Few-Shot Learners},
  author = {Core Team and Dong Zhang and Gang Wang and Jinlong Xue and Kai Fang and Liang Zhao and Rui Ma and Shuhuai Ren and Shuo Liu and Tao Guo and Weiji Zhuang and Xin Zhang and Xingchen Song and Yihan Yan and Yongzhe He and Cici and Bowen Shen and Chengxuan Zhu and Chong Ma and Chun Chen and Heyu Chen and Jiawei Li and Lei Li and Menghang Zhu and Peidian Li and Qiying Wang and Sirui Deng and Weimin Xiong and Wenshan Huang and Wenyu Yang and Yilin Jiang and Yixin Yang and Yuanyuan Tian and Yue Ma and Yue Yu and Zihan Zhang and Zihao Yue and Bangjun Xiao and Bingquan Xia and Bofei Gao and Bowen Ye and Can Cai and Chang Liu and Chenhong He and Chunan Li and Dawei Zhu and Duo Zhang and Fengyuan Shi and Guoan Wang and Hailin Zhang and Hanglong Lv and Hanyu Li and Hao Tian and Heng Qu and Hongshen Xu and Houbin Zhang and Huaqiu Liu and Jiangshan Duo and Jianguang Zuo and Jianyu Wei and Jiebao Xiao and Jinhao Dong and Jun Shi and Junhao Hu and Kainan Bao and Kang Zhou and Linghao Zhang and Meng Chen and Nuo Chen and Peng Zhang and Qianli Chen and Qiantong Wang and Rang Li and Shaohui Liu and Shengfan Wang and Shicheng Li and Shihua Yu and Shijie Cao and Shimao Chen and Shuhao Gu and Weikun Wang and Wenhan Ma and Xiangwei Deng and Xing Yong and Xing Zhang and Xu Wang and Yifan Song and Yihao Zhao and Yingbo Zhao and Yizhao Gao and Yu Cheng and Yu Tu and Yudong Wang and Zhaojun Huang and Zhengju Tang and Zhenru Lin and Zhichao Song and Zhipeng Xu and Zhixian Zheng and Zihan Jiang},
  journal= {arXiv preprint arXiv:2512.23808},
  year   = {2026}
}
R2 v1 2026-07-01T08:44:57.480Z