AIM:面向视觉问答持续学习的非对称信息掩码
计算机视觉与模式识别
2026-04-17 v1 计算与语言
摘要
在持续视觉问答(VQA)任务中,现有持续学习(CL)方法大多针对对称、单模态架构进行构建。然而,现代视觉语言模型(VLMs)违背了这一假设,因为其可训练组件本质上是非对称的。这种结构性不匹配导致VLMs在从连续数据流中学习时极易遭受灾难性遗忘。具体而言,非对称性使得标准全局正则化方法在优化过程中偏向于庞大的语言解码器,导致规模较小但关键的视觉投影层层然受到干扰。由此产生的局部性退化,进而导致组合推理能力的严重丧失。为此,我们提出了非对称信息掩码(AIM),通过基于模态特定灵敏度的精准掩码,平衡稳定性与可塑性。在VQA v2和GQA的持续VQA设置下,实验表明,AIM在平均性能(AP)和平均遗忘(AF)方面均实现了最先进水平,同时更好地保留了对新颖技能-概念组合的泛化能力。
引用
@article{arxiv.2604.14779,
title = {AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning},
author = {Peifeng Zhang and Zice Qiu and Donghua Yu and Shilei Cao and Juepeng Zheng and Yutong Lu and Haohuan Fu},
journal= {arXiv preprint arXiv:2604.14779},
year = {2026}
}
备注
18 pages, 9 figures. Submitted to ACM MM 2026