多模态大语言模型的模态不一致持续学习
机器学习
2026-05-13 v2 人工智能
计算与语言
计算机视觉与模式识别
声音
音频与语音处理
摘要
在本文中,我们引入了模态不一致持续学习(MICL),这是一种针对多模态大语言模型(MLLM)的新型持续学习场景,涉及具有不一致模态(图像、音频或视频)和不同任务类型(图像描述或问答)的任务。与现有的仅视觉或模态增量设置不同,MICL 结合了模态和任务类型的转变,两者都会导致灾难性遗忘。为了应对这些挑战,我们提出了 MoInCL,它采用伪目标生成模块来减轻先前已见模态中由任务类型转变引起的遗忘。它还结合了基于指令的知识蒸馏,以在新模态引入时保持模型处理先前学习模态的能力。我们使用共六项任务对 MICL 进行了基准测试,并进行了实验以验证 MoInCL 的有效性。实验结果突出了 MoInCL 的优越性,相较于具有代表性的和 SOTA 持续学习基线显示出显著改进。
引用
@article{arxiv.2412.13050,
title = {Modality-Inconsistent Continual Learning of Multimodal Large Language Models},
author = {Weiguo Pian and Shijian Deng and Shentong Mo and Mingrui Liu and Yunhui Guo and Yapeng Tian},
journal= {arXiv preprint arXiv:2412.13050},
year = {2026}
}
备注
Accepted at Transactions on Machine Learning Research (TMLR), 2026