中文

面向视觉对话的图像-问题-答案协同网络

计算与语言 2019-02-27 v1 计算机视觉与模式识别

摘要

图像、问题(结合历史以消解指代)以及相应答案是视觉对话的三个重要组成部分。经典视觉对话系统整合图像、问题和历史来搜索或生成最匹配的答案,因此这种方法显著忽略了答案的作用。本文设计了一种新颖的图像-问题-答案协同网络,以重视答案在精确视觉对话中的作用。我们将传统单阶段方案扩展为两阶段方案。第一阶段中,根据候选答案与图像和问题对的关联度进行粗评分。随后,在第二阶段,高正确概率的答案通过与图像和问题协同而重新排序。在 Visual Dialog v1.0 数据集上,所提协同网络将判别式视觉对话模型提升至 57.88% 归一化折损累积增益的新最优(state-of-the-art)水平。配备该技术的生成式视觉对话模型也显示出有前景的改进。

关键词

引用

@article{arxiv.1902.09774,
  title  = {Image-Question-Answer Synergistic Network for Visual Dialog},
  author = {Dalu Guo and Chang Xu and Dacheng Tao},
  journal= {arXiv preprint arXiv:1902.09774},
  year   = {2019}
}

备注

Accepted by cvpr2019