来自多场景视角的多模态持续学习
计算机视觉与模式识别
2026-03-16 v3 人工智能
摘要
部署在设备上的多模态大语言模型(MLLMs)必须适应不断变化的视觉场景,如背景和视角的变化,以有效执行复杂的视觉任务。为调查现实场景迁移下的灾难性遗忘,我们构建了一个多模态视觉理解数据集(MSVQA),涵盖四个不同场景和视角:高空、 underwater、低空和室内环境。此外,我们提出了UNIFIER(mUltimodal coNtInual learning with MLLMs From multi-scenarIo pERspectives),一个旨在解决视觉差异并学习不同场景的持续学习(Continual Learning, CL)框架。与现有CL方法相比,UNIFIER通过视觉表示扩展(Vision Representation Expansion, VRE)和视觉一致性约束(Vision Consistency Constraint, VCC)实现同一场景内的知识积累以及跨不同场景的相互增强。实验结果表明,在20步跨场景持续学习任务中,UNIFIER相对于最先进的方法QUAD,最后一步的VQA得分提高2.70%~10.62%,最后一步的F1得分提高3.40%~7.69%。MSVQA数据集可在https://huggingface.co/datasets/Kaij00/MSVQA 获取。
引用
@article{arxiv.2511.18507,
title = {Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives},
author = {Kai Jiang and Siqi Huang and Xiangyu Chen and Jiawei Shao and Hongyuan Zhang and Ping Luo and Xuelong Li},
journal= {arXiv preprint arXiv:2511.18507},
year = {2026}
}
备注
22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026