面向问题生成的视觉对话状态跟踪
计算机视觉与模式识别
2019-11-26 v2 人工智能
机器学习
摘要
GuessWhat?! 是猜测者(guesser)与先知(oracle)之间的一种视觉对话任务。猜测者旨在通过提出一系列是非(Yes/No)问题,在图像中定位由先知本人所设想的一个物体。随着对话推进提出恰当的问题,对于成功完成最终猜测至关重要。因此,对话的进展应当被恰当地表示与跟踪。以往用于问题生成的模型较少关注对话状态的表示与跟踪,因此容易提出低质量的问题,例如重复问题。本文提出一种基于视觉对话状态跟踪(VDST)的问题生成方法。视觉对话状态被定义为图像中物体的分布以及物体的表示。物体的表示随物体分布的变化而更新。一种基于物体差异的注意力机制被用于解码新的问题。物体分布通过比较问答对与物体来更新。在 GuessWhat?! 数据集上的实验结果表明,我们的模型显著优于现有方法并取得了新的 SOTA 性能。同样值得注意的是,与先前 SOTA 方法相比,我们的模型将重复问题的比例从 50% 以上降低到了 21.9%。
引用
@article{arxiv.1911.07928,
title = {Visual Dialogue State Tracking for Question Generation},
author = {Wei Pang and Xiaojie Wang},
journal= {arXiv preprint arXiv:1911.07928},
year = {2019}
}
备注
8 pages, 4 figures, Accept-Oral by AAAI-2020