找不同:非完全共视场景下的协作式物体指代游戏
计算机视觉与模式识别
2022-03-17 v1 计算与语言
摘要
在将各种面向视觉的目标引入对话后,视觉对话取得了巨大进展,尤其是 GuessWhich 和 GuessWhat,其中唯一图像分别仅由提问者或提问者与回答者双方可见。研究者在单图或完全共视视觉场景的视觉对话任务上探索较多,却在一定程度上忽视了对非完全共视视觉场景任务的探索,而后者中两智能体所访问的图像可能并不完全一致,这在实践中经常发生。尽管通过对话在非完全共视视觉场景中建立共识对高级对话智能体十分重要,但此类对话任务及相应大规模数据集的缺失使得深入研究无从开展。为打破这一限制,我们提出一种非完全共视视觉场景下的物体指代游戏,其目标是通过自然语言对话找出相似视觉场景之间的差异。该任务应对了非完全共视视觉场景中的对话策略挑战以及物体分类能力挑战。相应地,我们构建了一个名为 SpotDiff 的大规模多模态数据集,包含 8.7 万张虚拟现实图像和由自博弈生成的 9.7 万段对话。最后,我们给出了该任务的基准模型,并开展大量实验以评估其性能并分析其主要挑战。
引用
@article{arxiv.2203.08362,
title = {Spot the Difference: A Cooperative Object-Referring Game in Non-Perfectly Co-Observable Scene},
author = {Duo Zheng and Fandong Meng and Qingyi Si and Hairun Fan and Zipeng Xu and Jie Zhou and Fangxiang Feng and Xiaojie Wang},
journal= {arXiv preprint arXiv:2203.08362},
year = {2022}
}