中文

VQA中的问题相关性:识别非视觉与错误前提问题

计算机视觉与模式识别 2016-09-27 v3 计算与语言 机器学习

摘要

视觉问答(VQA)是回答关于图像的自然语言问题的任务。我们引入了在VQA中确定问题与图像相关性的新问题。当前的VQA模型不会推理一个问题是否与给定图像相关(例如阿根廷的首都是什么?)或是否需要外部资源的信息才能正确回答。这会破坏人机交互中对话的连续性。我们确定相关性的方法由两个阶段组成。给定一张图像和一个问题,(1) 我们首先确定该问题是否为视觉问题,(2) 如果是视觉问题,我们再确定该问题是否与给定图像相关。我们基于 LSTM-RNNs、VQA 模型不确定性和标题-问题相似性的方法,在两个相关性任务上均优于强基线。我们还展示了人类研究,表明增强了此类问题相关性推理的 VQA 模型被认为是更具智能、更合理且更像人类的。

关键词

引用

@article{arxiv.1606.06622,
  title  = {Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions},
  author = {Arijit Ray and Gordon Christie and Mohit Bansal and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1606.06622},
  year   = {2016}
}

备注

Conference on Empirical Methods in Natural Language Processing (EMNLP) 2016