中文

MIO:基于多模态标记的基础模型

计算与语言 2025-10-17 v4 人工智能 机器学习

摘要

本文介绍了MIO,这是一个基于多模态标记构建的新型基础模型,能够以端到端、自回归方式理解和生成语音、文本、图像和视频。尽管大型语言模型(LLM)和多模态大型语言模型(MM-LLM)通过其多样化能力推动了人工通用智能的发展,但它们仍缺乏真正的“任意到任意”理解与生成能力。最近,GPT-4o的发布展示了任意到任意LLM在复杂现实任务中的惊人潜力,实现了图像、语音和文本之间的全向输入输出。然而,该模型为闭源且不支持生成多模态交错序列。为填补这一空白,我们提出MIO,该模型通过因果多模态建模在四种模态的离散标记上进行训练。MIO经过四阶段训练过程:(1)对齐预训练,(2)交错预训练,(3)语音增强预训练,(4)在多样化文本、视觉和语音任务上的综合监督微调。我们的实验结果表明,MIO在与之前双模态基线、任意到任意模型基线以及甚至模态特定基线的比较中,表现出竞争力,甚至在某些情况下表现优于先前方法。此外,MIO展示了其“任意到任意”特性所特有的先进能力,例如交错视频-文本生成、链式视觉思考推理、视觉指南生成、指令图像编辑等。

关键词

引用

@article{arxiv.2409.17692,
  title  = {MIO: A Foundation Model on Multimodal Tokens},
  author = {Zekun Wang and King Zhu and Chunpu Xu and Wangchunshu Zhou and Jiaheng Liu and Yibo Zhang and Jiashuo Wang and Ning Shi and Siyu Li and Yizhi Li and Haoran Que and Zhaoxiang Zhang and Yuanxing Zhang and Ge Zhang and Ke Xu and Jie Fu and Wenhao Huang},
  journal= {arXiv preprint arXiv:2409.17692},
  year   = {2025}
}

备注

EMNLP 2025 (Oral). Codes and models are available in https://github.com/MIO-Team/MIO