面向视觉对话的图像-问题-答案协同网络
计算与语言
2019-02-27 v1 计算机视觉与模式识别
摘要
图像、问题(结合历史以消解指代)以及相应答案是视觉对话的三个重要组成部分。经典视觉对话系统整合图像、问题和历史来搜索或生成最匹配的答案,因此这种方法显著忽略了答案的作用。本文设计了一种新颖的图像-问题-答案协同网络,以重视答案在精确视觉对话中的作用。我们将传统单阶段方案扩展为两阶段方案。第一阶段中,根据候选答案与图像和问题对的关联度进行粗评分。随后,在第二阶段,高正确概率的答案通过与图像和问题协同而重新排序。在 Visual Dialog v1.0 数据集上,所提协同网络将判别式视觉对话模型提升至 57.88% 归一化折损累积增益的新最优(state-of-the-art)水平。配备该技术的生成式视觉对话模型也显示出有前景的改进。
引用
@article{arxiv.1902.09774,
title = {Image-Question-Answer Synergistic Network for Visual Dialog},
author = {Dalu Guo and Chang Xu and Dacheng Tao},
journal= {arXiv preprint arXiv:1902.09774},
year = {2019}
}
备注
Accepted by cvpr2019