中文

前提的潜力:视觉问答中问题前提的利用

计算机视觉与模式识别 2017-08-21 v2 计算与语言

摘要

在本文中,我们提出一个简单观察:关于图像的问题通常包含前提——即问题所隐含的对象和关系——并且对前提进行推理可以帮助视觉问答(VQA)模型更智能地回应无关或先前未见的问题。当面对与图像无关的问题时,最先进的 VQA 模型仍会纯粹基于学到的语言偏差来回答,导致无意义甚至误导性的答案。我们注意到,如果视觉问题的至少一个前提为假(即图像中未描绘),则该视觉问题与图像无关。我们利用此观察,通过搜索错误前提来构建用于问题相关性预测与解释(QRPE)的数据集。我们训练了新颖的问题相关性检测模型,并表明对前提进行推理的模型持续优于不进行推理的模型。我们还发现,在训练期间强制标准 VQA 模型推理前提可以提升在需要组合推理的任务上的表现。

关键词

引用

@article{arxiv.1705.00601,
  title  = {The Promise of Premise: Harnessing Question Premises in Visual Question Answering},
  author = {Aroma Mahendru and Viraj Prabhu and Akrit Mohapatra and Dhruv Batra and Stefan Lee},
  journal= {arXiv preprint arXiv:1705.00601},
  year   = {2017}
}

备注

Published at EMNLP 2017