中文

LLaVA-CMoE: 面向大型视觉语言模型的持续混合专家

计算与语言 2025-06-26 v3

摘要

混合专家(MoE)架构最近推动了大型语言模型(LLM)在持续多模态学习中的可扩展性和适应性。然而,高效扩展这些模型以适应顺序任务仍具有挑战性。当新任务到来时,朴素的模型扩张会导致参数快速增长,而修改共享路由组件则可能引发灾难性遗忘,削弱先前学习的知识。为此,我们提出LLaVA-CMoE,一个无需依赖先前任务重放数据的持续学习框架,确保参数效率和稳健的知识保留。我们的方案引入探针引导的知识扩展机制,通过探针专家动态确定何时何处添加新专家,实现针对任务复杂度的自适应和最小参数扩张。进一步,我们提出概率任务定位器,为每个任务分配专用轻量级路由器。为解决推理期间任务标签未知的实际问题,我们采用VAE基方法识别最合适的路由器,通过匹配输入分布实现自动且精确的专家分配。该设计缓解了路由冲突和灾难性遗忘,实现无显式任务标签的稳健持续学习。广泛实验在覆盖八个多样化VQA任务的CoIN基准上表明,LLaVA-CMoE以紧凑模型规模实现强劲的持续学习性能,显著降低了遗忘和参数开销,相较于先前方法。这些结果展示了该方法在大型语言模型参数高效持续学习中的有效性和可扩展性。我们的代码即将开源。

关键词

引用

@article{arxiv.2503.21227,
  title  = {LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models},
  author = {Hengyuan Zhao and Ziqin Wang and Qixin Sun and Kaiyou Song and Yilin Li and Xiaolin Hu and Qingpei Guo and Si Liu},
  journal= {arXiv preprint arXiv:2503.21227},
  year   = {2025}
}

备注

Preprint