中文

符号重放:以场景图作为提示的持续学习在VQA任务上的应用

计算机视觉与模式识别 2022-08-31 v2

摘要

VQA是一项旨在回答任何图像相关问题的雄心勃勃的任务。然而现实中,由于用户需求持续更新且系统必须实现新功能,很难一次性构建这样的系统。因此,持续学习(CL)能力是开发先进VQA系统的必备条件。最近,一项开创性工作将VQA数据集拆分为不相交的答案集来研究该主题。然而,VQA上的CL不仅涉及标签集的扩展(新答案集)。研究在将VQA系统部署到新环境(新视觉场景)时如何回答问题,以及如何回答需要新功能的问题(新问题类型)至关重要。因此,我们提出CLOVE,一个用于视觉问答持续学习(Continual Learning On Visual quEstion answering)的基准,包含针对上述两种CL场景的基于场景和基于功能的增量设置。在方法论上,VQA上的CL与分类的主要区别在于前者额外涉及推理机制的扩展与防遗忘,而后者聚焦于类表示。因此,我们提出一种专为VQA上CL定制的无真实数据重放方法,名为Scene Graph as Prompt for Symbolic Replay(以场景图作为符号重放的提示)。使用一段场景图作为提示,它重放伪场景图来表示过去图像,以及相关的QA对。还提出了一个统一的VQA模型,利用当前和重放数据增强其QA能力。最后,实验结果揭示了CLOVE中的挑战并证明了我们方法的有效性。数据集和代码将发布于https://github.com/showlab/CLVQA。

关键词

引用

@article{arxiv.2208.12037,
  title  = {Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task},
  author = {Stan Weixian Lei and Difei Gao and Jay Zhangjie Wu and Yuxuan Wang and Wei Liu and Mengmi Zhang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2208.12037},
  year   = {2022}
}

备注

18 pages, 13 figures