中文

利用 Mixture-of-Experts 冗余解锁多模态生成能力

计算与语言 2025-04-02 v2 人工智能 计算机视觉与模式识别

摘要

本文聚焦于在满足两个核心约束的前提下,增强预训练文本-only 大语言模型(LLM)的生成能力,以实现多模态生成:C1 保持原始语言生成能力,几乎不产生性能下降;C2 遵循小参数预算学习新模态,确保可扩展性和效率。与当前添加专用模块从而显著增加参数数量的方法不同,我们提出一种方法,利用深层模型中未被充分利用的容量。具体而言,我们利用 Mixture-of-Experts(MoE)中的参数冗余作为学习新模态的额外容量来源,从而实现更好的参数效率(满足 C1)。此外,我们仅对新模态的 token 应用低秩适配,以保留原始语言生成能力(满足 C2)。进一步,我们引入一种基于 Gromov-Wasserstein 距离的新型参数初始化方案,以提高收敛性和训练稳定性。通过对路由机制的广泛分析,我们发现特定模态路径的出现以及专家中冗余度的降低,这些现象可以有效地解锁多模态生成能力。总体而言,我们的方法可以无缝应用于广泛的当代 LLM,为从单模态向多模态架构的转变提供了一条新途径。

关键词

引用

@article{arxiv.2503.22517,
  title  = {Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities},
  author = {Raman Dutt and Harleen Hanspal and Guoxuan Xia and Petru-Daniel Tudosiu and Alexander Black and Yongxin Yang and Steven McDonagh and Sarah Parisot},
  journal= {arXiv preprint arXiv:2503.22517},
  year   = {2025}
}