中文

一个持续学习的VLM:用于无数据持续视觉问答的生成与平衡

计算机视觉与模式识别 2025-03-19 v2

摘要

视觉语言模型(VLMs)通过利用网页规模多模态数据集,在视觉问答(VQA)任务中展现了显著潜力。然而,这些模型在适应新任务时常常因灾难性遗忘而难以持续学习。作为缓解灾难性遗忘的有效方法,重演策略在学习新任务时使用过去任务的数据。然而,此类策略需要存储过去数据,这在硬件限制或隐私顾虑下可能不可行。本工作中,我们提出了一种首个无数据方法,利用VLM的语言生成能力(而非依赖外部模型)来产生伪重演数据以解决持续VQA问题。我们的方案名为GaB,通过在新任务数据上提出过去任务的问题来生成伪重演数据。然而,尽管有效,由于有限且任务特定的训练数据,生成问题的分布会偏向于被最频繁提出的问题。为缓解此问题,我们引入了一个伪重演平衡模块,利用问题元统计或无监督聚类方法将生成数据对齐到真实数据分布。我们在两个近期基准上评估了所提方法,即VQACL-VQAv2和CLOVE-function基准。GaB在所有无数据基线之上取得了显著提升,在跨演化任务维持VQA性能方面表现优异,同时与可访问过去数据的方法表现相当。

关键词

引用

@article{arxiv.2411.02210,
  title  = {One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering},
  author = {Deepayan Das and Davide Talon and Massimiliano Mancini and Yiming Wang and Elisa Ricci},
  journal= {arXiv preprint arXiv:2411.02210},
  year   = {2025}
}