中文

面向语言导向的全模态大型语言模型:Uni-MoE-2.0-Omni 采用先进混合专家、训练与数据策略

计算与语言 2025-11-25 v2 人工智能 计算机视觉与模式识别

摘要

我们提出了来自 Lychee 系列的 Uni-MoE 2.0。作为完全开源的全模态大型模型 (OLM),它在语言中心的多模态理解、推理和生成方面显著推进了 Lychee Uni-MoE 系列的发展。基于密集 LLM,我们通过三个核心贡献从零构建 Uni-MoE-2.0-Omni:动态容量混合专家 (MoE) 设计、增强迭代强化策略的渐进式训练策略,以及精心策划的多模态数据匹配技术。它能够实现全模态理解,以及生成图像、文本和语音。从结构上看,新的 MoE 框架在 10 种跨模态输入中实现计算效率和能力的平衡,同时我们的 Omni-Modality 3D RoPE 确保自注意力层中的时空跨模态对齐。对于训练,遵循跨模态预训练,我们使用渐进式监督微调策略激活特定模态的专家,并通过平衡数据组成和迭代 GSPO-DPO 方法稳定 RL 训练并提高推理。数据方面, base 模型在约 7500 亿个开源多模态数据的训练中配备特殊语音和图像生成标记,使其能够通过语言线索条件化其输出来学习这些生成任务。广泛的评估在 85 个基准测试上表明,我们的模型在对手 OLMs 中实现 SOTA 或高度竞争的性能,超过在 76 个基准测试中使用 1.2 万亿 token 训练的 Qwen2.5-Omni 的 50 个以上。关键优势包括视频理解 (+8%平均提升)、全模态理解 (+4%平均提升) 和音视频推理 (+4%)。它还在长句语音处理中取得进展(WER 降低 4.2%),并在低级图像处理和可控生成的 5 个指标中领先。

关键词

引用

@article{arxiv.2511.12609,
  title  = {Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data},
  author = {Yunxin Li and Xinyu Chen and Shenyuan Jiang and Haoyuan Shi and Zhenyu Liu and Xuanyu Zhang and Nanhao Deng and Zhenran Xu and Yicheng Ma and Meishan Zhang and Baotian Hu and Min Zhang},
  journal= {arXiv preprint arXiv:2511.12609},
  year   = {2025}
}

备注

47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE