VQA中的问题相关性:识别非视觉与错误前提问题
计算机视觉与模式识别
2016-09-27 v3 计算与语言
机器学习
摘要
视觉问答(VQA)是回答关于图像的自然语言问题的任务。我们引入了在VQA中确定问题与图像相关性的新问题。当前的VQA模型不会推理一个问题是否与给定图像相关(例如阿根廷的首都是什么?)或是否需要外部资源的信息才能正确回答。这会破坏人机交互中对话的连续性。我们确定相关性的方法由两个阶段组成。给定一张图像和一个问题,(1) 我们首先确定该问题是否为视觉问题,(2) 如果是视觉问题,我们再确定该问题是否与给定图像相关。我们基于 LSTM-RNNs、VQA 模型不确定性和标题-问题相似性的方法,在两个相关性任务上均优于强基线。我们还展示了人类研究,表明增强了此类问题相关性推理的 VQA 模型被认为是更具智能、更合理且更像人类的。
引用
@article{arxiv.1606.06622,
title = {Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions},
author = {Arijit Ray and Gordon Christie and Mohit Bansal and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1606.06622},
year = {2016}
}
备注
Conference on Empirical Methods in Natural Language Processing (EMNLP) 2016