MLLM-CL:多模态大语言模型的持续学习
计算与语言
2025-10-02 v2 人工智能
计算机视觉与模式识别
摘要
最近的多模态大语言模型(MLLMs)在视觉语言理解方面表现卓越,但在需要持续集成新知识与技能以适应动态现实场景的情境下仍面临挑战。虽然持续学习(CL)提供了潜在解决方案,但现有基准测试和方法存在关键局限。本文引入 MLLM-CL,一个涵盖领域持续学习与能力持续学习的新型基准测试,其中前者聚焦于跨越不断演变的主流领域的独立同分布(IID)评估,而后者则针对非 IID 场景中的新模型能力进行评估。在方法层面,我们通过参数隔离和基于 MLLM 的路由机制,防止灾难性遗忘。大量实验表明,我们的方法能够以最小的遗忘效应集成领域特定知识与功能能力,显著优于现有方法。我们的基准测试与代码已发布于 https://github.com/bjzhb666/MLLM-CL。
引用
@article{arxiv.2506.05453,
title = {MLLM-CL: Continual Learning for Multimodal Large Language Models},
author = {Hongbo Zhao and Fei Zhu and Haiyang Guo and Meng Wang and Rundong Wang and Gaofeng Meng and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2506.05453},
year = {2025}
}