CL-MoE:基于双动量混合专家网络增强多模态大语言模型以应对持续视觉问答
计算机视觉与模式识别
2025-03-04 v1 机器学习
摘要
多模态大语言模型(MLLMs)因其在视觉语言任务(如视觉问答)中的卓越理解与生成能力而受到研究者广泛关注。然而,现实世界知识的快速更新使得 MLLMs 的离线训练成本高昂,并在面对非平稳数据流时会因学习过程中的灾难性遗忘现象而受到影响。本文提出一种基于 MLLMs 的双动量混合专家(CL-MoE)框架,用于持续视觉问答(VQA)。我们将 MLLMs 与持续学习相结合,利用 LLMs 中的丰富常识知识。引入双路由混合专家(RMoE)策略,通过任务级和实例级路由器选择全局专家和局部专家,以稳健地为最适合当前任务的专家分配权重。随后设计动态动量混合专家(MMoE),根据专家与任务/实例之间的关系,动态更新专家参数,以实现在吸收新知识的同时保持已有知识。大量实验结果表明,我们的方法在 10 个 VQA 任务上实现了最新进展,证明了该方法的有效性。
引用
@article{arxiv.2503.00413,
title = {CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering},
author = {Tianyu Huai and Jie Zhou and Xingjiao Wu and Qin Chen and Qingchun Bai and Ze Zhou and Liang He},
journal= {arXiv preprint arXiv:2503.00413},
year = {2025}
}
备注
10 pages,4 figures,accepted by CVPR2025