用于视觉对话的多视角注意力网络
人工智能
2020-10-08 v3 计算与语言
摘要
视觉对话是一项具有挑战性的视觉-语言任务,其中需回答由给定图像视觉锚定的连续问题。要解决视觉对话任务,需要对各种多模态输入(例如问题、对话历史和图像)的高层理解。具体而言,智能体有必要:1)确定问题的语义意图;2)在异构模态输入中对齐与问题相关的文本与视觉内容。在本文中,我们提出多视角注意力网络(MVAN),其基于注意力机制利用关于异构输入的多个视角。MVAN 通过两个互补模块(即主题聚合与上下文匹配)有效从对话历史中捕获问题相关信息,并通过顺序对齐过程(即模态对齐)构建多模态表示。在 VisDial v1.0 数据集上的实验结果表明了我们提出模型的有效性,其在所有评估指标上均优于先前的最先进方法。
引用
@article{arxiv.2004.14025,
title = {Multi-View Attention Network for Visual Dialog},
author = {Sungjin Park and Taesun Whang and Yeochan Yoon and Heuiseok Lim},
journal= {arXiv preprint arXiv:2004.14025},
year = {2020}
}