视觉对话中的递归视觉注意力
计算机视觉与模式识别
2019-04-09 v2
摘要
视觉对话是一项具有挑战性的视觉-语言任务,要求智能体回答关于图像的多轮问题。它通常需要解决两个主要问题:(1)如何回答视觉接地问题,这是视觉问答(VQA)的核心挑战;(2)如何推断问题与对话历史之间的共指关系。视觉共指的一个例子是:问题(例如“它们是开着的还是关着的?”)中的代词(例如“它们”)与对话历史(例如“那里有多少盏灯?”)中出现的名词(例如“灯”)以及图像中接地的对象相关联。在这项工作中,为解决视觉对话的视觉共指问题,我们提出了一种称为递归视觉注意力(RvA)的新型注意力机制。具体而言,我们的对话智能体浏览对话历史,直到其对视觉共指消解具有足够置信度,并递归地细化视觉注意力。在大规模 VisDial v0.9 和 v1.0 数据集上的定量与定性实验结果表明,所提出的 RvA 不仅优于当前最优(state-of-the-art)方法,而且无需额外标注即可实现合理的递归与可解释的注意力图。代码见 \url{https://github.com/yuleiniu/rva}。
引用
@article{arxiv.1812.02664,
title = {Recursive Visual Attention in Visual Dialog},
author = {Yulei Niu and Hanwang Zhang and Manli Zhang and Jianhong Zhang and Zhiwu Lu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:1812.02664},
year = {2019}
}
备注
CVPR 2019 (Oral)