中文

利用自监督学习克服视觉问答中的语言先验

计算机视觉与模式识别 2020-12-22 v1 多媒体

摘要

大多数视觉问答(VQA)模型受限于由固有数据偏置引起的语言先验问题。具体而言,VQA 模型倾向于基于高频答案(如黄色)来回答问题(如香蕉是什么颜色?),而忽略图像内容。现有方法通过设计精细模型或引入额外视觉标注来降低问题依赖、增强图像依赖以应对该问题。然而,由于数据偏置并未得到缓解,它们仍受语言先验问题困扰。本文中,我们引入一种自监督学习框架来解决此问题。具体地,我们首先自动生成标注数据以平衡有偏数据,并提出一项自监督辅助任务,利用平衡数据辅助基础 VQA 模型克服语言先验。我们的方法可在不引入外部标注的情况下通过生成平衡数据弥补数据偏置。实验结果表明,我们的方法显著优于当前最优(state-of-the-art),在最常用的基准 VQA-CP v2 上将总体准确率从 49.50% 提升至 57.59%。换言之,我们能在不使用外部标注的情况下将基于标注方法的性能提升 16%。

关键词

引用

@article{arxiv.2012.11528,
  title  = {Overcoming Language Priors with Self-supervised Learning for Visual Question Answering},
  author = {Xi Zhu and Zhendong Mao and Chunxiao Liu and Peng Zhang and Bin Wang and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2012.11528},
  year   = {2020}
}

备注

Accepted by IJCAI 2020