中文

视觉问答中语言先验问题的量化与缓解

计算机视觉与模式识别 2019-05-14 v1 计算与语言 信息检索

摘要

受益于计算机视觉、自然语言处理与信息检索技术的进步,旨在回答关于图像或视频问题的视觉问答(VQA)在过去几年中受到了广泛关注。尽管目前已取得一定进展,若干研究指出当前 VQA 模型深受“语言先验问题”的影响,即它们倾向于依据问题关键词(如 how many)与答案(如 2)的共现模式来回答问题,而非理解图像与问题。现有方法试图通过平衡有偏数据集或迫使模型更好地理解图像来解决该问题。然而,第一种方案仅观察到微弱效果,第二种方案甚至出现了性能退化。此外,另一个重要问题是缺乏定量度量语言先验影响程度的指标,这严重阻碍了相关技术的发展。本文从两个角度着手解决上述问题。首先,我们设计了一种用于定量度量 VQA 模型语言先验影响的指标,所提指标在实证研究中被证明有效。其次,我们提出了一种正则化方法(即分数正则化模块),通过缓解语言先验问题并提升骨干模型性能来增强当前 VQA 模型。所提分数正则化模块采用成对学习策略,使 VQA 模型基于图像(针对该问题)的推理来回答问题,而非基于有偏训练集中观察到的问题-答案模式。该分数正则化模块可灵活集成到多种 VQA 模型中。

关键词

引用

@article{arxiv.1905.04877,
  title  = {Quantifying and Alleviating the Language Prior Problem in Visual Question Answering},
  author = {Yangyang Guo and Zhiyong Cheng and Liqiang Nie and Yibing Liu and Yinglong Wang and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:1905.04877},
  year   = {2019}
}