中文

CL-CrossVQA:一种用于跨域视觉问答的持续学习基准

计算机视觉与模式识别 2022-11-22 v1

摘要

视觉问答 (VQA) 是一项多学科研究任务。为给出正确回答,它需要理解图像的视觉内容、自然语言问题,以及对图像所含信息和世界知识的常识推理。近来,大规模视觉-语言预训练模型 (VLPMs) 因其优越性能成为 VQA 任务的主流方法。标准做法是在大规模通用域数据集上预训练的 VLPMs,使用特定域 VQA 数据集进行微调。然而在现实中,应用域会随时间变化,要求 VLPMs 持续学习并适应新域而不遗忘先前习得的知识。现有大多数持续学习 (CL) 研究集中于单模态任务,而更实际的的应用场景,即跨域 VQA 上的 CL,尚未被研究。受此启发,我们提出 CL-CrossVQA,一个严格的跨域视觉问答持续学习基准,通过它在 4 个 VLPMs、4 种 CL 方法和来自不同域的 5 个 VQA 数据集上进行了广泛实验。此外,通过探查中间层的遗忘现象,我们深入分析了模型架构如何影响 CL 性能、为何 CL 方法能在某种程度上帮助缓解 VLPMs 中的遗忘,以及如何在此具挑战性的持续学习环境中设计适用于 VLPMs 的 CL 方法。为促进未来跨域 VQA 的 CL 研究,我们将发布数据集与代码。

关键词

引用

@article{arxiv.2211.10567,
  title  = {CL-CrossVQA: A Continual Learning Benchmark for Cross-Domain Visual Question Answering},
  author = {Yao Zhang and Haokun Chen and Ahmed Frikha and Yezi Yang and Denis Krompass and Gengyuan Zhang and Jindong Gu and Volker Tresp},
  journal= {arXiv preprint arXiv:2211.10567},
  year   = {2022}
}

备注

10 pages, 6 figures