M2-omni:推进全模态大语言模型,实现全面模态支持与竞争力性能
机器学习
2025-04-08 v3 人工智能
计算与语言
摘要
我们提出 M2-omni,一个最先进的、开源的全模态大语言模型,其性能可与 GPT-4o 相媲美。M2-omni 采用统一的多模态序列建模框架,赋予大语言模型(LLM)全面的跨模态理解与生成能力。具体而言,M2-omni 可以处理任意组合的音频、视频、图像和文本模态作为输入,生成交错包含音频、图像或文本输出的多模态序列,从而实现先进且交互式的实时体验。这类全模态大语言模型的训练面临各模态之间数据量和收敛速率的巨大差异所带来的挑战。为应对这些挑战,我们提出了一种预训练阶段的逐步平衡策略,以处理各模态特定数据的数量差异。此外,在指令微调阶段引入了一种动态自适应平衡策略,以同步各模态的训练进度,确保最优收敛。值得注意的是,我们优先保持在纯文本任务上的强劲性能,以在整个训练过程中维持 M2-omni 语言理解能力的鲁棒性。据我们所知,M2-omni 目前是与 GPT-4o 极具竞争力的开源模型,以其全面的模态与任务支持以及卓越的性能为特征。我们期望 M2-omni 将推动全模态大语言模型的发展,从而促进该领域未来的研究。
引用
@article{arxiv.2502.18778,
title = {M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance},
author = {Qingpei Guo and Kaiyou Song and Zipeng Feng and Ziping Ma and Qinglong Zhang and Sirui Gao and Xuzheng Yu and Yunxiao Sun and Tai-Wei Chang and Jingdong Chen and Ming Yang and Jun Zhou},
journal= {arXiv preprint arXiv:2502.18778},
year = {2025}
}