用于视觉对话中视觉指代消解的双重注意力网络
计算机视觉与模式识别
2019-08-30 v3
摘要
视觉对话(VisDial)是一项要求AI智能体回答一系列基于图像的问题的任务。与视觉问答(VQA)不同,这一系列问题需要能够从对话历史中捕获时间上下文,并利用视觉基础信息。一个称为视觉指代消解的问题涉及这些挑战,要求智能体解析给定问题中的模糊指代,并在给定图像中找到这些指代。在本文中,我们提出了用于视觉指代消解的双重注意力网络(DAN)。DAN由两种注意力网络组成:REFER和FIND。具体来说,REFER模块通过自注意力机制学习给定问题与对话历史之间的潜在关系。FIND模块以图像特征和指代感知表示(即REFER模块的输出)为输入,并通过自底向上注意力机制执行视觉定位。我们在VisDial v1.0和v0.9数据集上进行了定性和定量评估,表明DAN以显著优势超越了之前的最先进模型。
引用
@article{arxiv.1902.09368,
title = {Dual Attention Networks for Visual Reference Resolution in Visual Dialog},
author = {Gi-Cheon Kang and Jaeseo Lim and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1902.09368},
year = {2019}
}
备注
EMNLP 2019