使用场景图和视觉注意力为视觉问答生成自然语言解释
计算与语言
2019-02-18 v1 人工智能
摘要
在本文中,我们提出了一种用于可解释问答(XQA)任务的新方法,即为视觉问答(VQA)问题生成自然语言(NL)解释。我们利用两个信息源生成包含支持针对图像所提问题答案证据的 NL 解释: 从图像场景图生成的图像中实体的标注(例如,物体标签、区域描述、关系短语),以及 VQA 模型在回答问题时生成的注意力图。我们展示了如何将视觉注意力图与使用语言模型精心挑选的相关场景图实体的 NL 表示相结合,从而在无需任何额外收集数据(解释字幕等)的情况下给出合理的文本解释。我们在 Visual Genome (VG) 数据集上运行了我们的算法,并进行了内部用户研究,以证明我们的方法相对于强基线的有效性。我们还发布了一个在线网络演示,展示了我们使用场景图和视觉注意力进行 VQA 和文本解释生成的效果。
引用
@article{arxiv.1902.05715,
title = {Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention},
author = {Shalini Ghosh and Giedrius Burachas and Arijit Ray and Avi Ziskind},
journal= {arXiv preprint arXiv:1902.05715},
year = {2019}
}