面向视觉对话的猜测状态跟踪
计算机视觉与模式识别
2020-07-21 v5
摘要
猜测者(Guesser)是 GuessWhat?! 类视觉对话中视觉定位的一项任务。它根据提问者(Questioner)与先知(Oracle)之间基于问答的对话,由先知自身假定,在图像中定位目标物体。大多数现有猜测者在接收完预设轮数的对话中所有问答对后仅做一次且唯一的猜测。本文为猜测者提出一种猜测状态,并将猜测视为随对话推进猜测状态变化的过程。据此提出一种基于猜测状态跟踪的猜测模型。猜测状态定义为图像中物体上的分布。基于此,定义两个损失函数作为模型训练的监督:早期监督在前期轮次向猜测者提供监督,增量监督为猜测状态带来单调性。在 GuessWhat?! 数据集上的实验结果表明,我们的模型显著优于先前模型,取得了新的 SOTA,尤其猜测成功率 83.3% 接近人类水平准确率 84.4%。
引用
@article{arxiv.2002.10340,
title = {Guessing State Tracking for Visual Dialogue},
author = {Wei Pang and Xiaojie Wang},
journal= {arXiv preprint arXiv:2002.10340},
year = {2020}
}
备注
Accepted at ECCV 2020. The paper is about how the Guesser in the GuessWhat?! game guess. More details can be found at https://github.com/xubuvd/guesswhat