CLEVR-Dialog:面向视觉对话中多轮推理的诊断数据集
计算机视觉与模式识别
2019-09-20 v2 人工智能
计算与语言
机器学习
摘要
视觉对话是一项多模态任务,即基于图像并借助对话历史作为上下文,回答一系列问题。它涉及视觉、语言、推理与接地(grounding)等方面的挑战。然而,在大型真实数据集上孤立地研究这些子任务并不可行,因为这需要对所有图像与对话的“状态”进行代价高昂的完整标注。我们开发了CLEVR-Dialog,一个用于研究视觉对话中多轮推理的大型诊断数据集。具体而言,我们构建了一种基于CLEVR数据集中图像的场景图接地的对话语法。这一组合产生了一个视觉对话各方面均被完整标注的数据集。总体而言,CLEVR-Dialog为约8.5万张CLEVR图像包含了每图10轮对话的5个实例,总计425万个问答对。我们使用CLEVR-Dialog对标准视觉对话模型的性能进行基准测试;特别是针对视觉共指消解(作为共指距离的函数)。这是对视觉对话模型的首个此类分析,若无该数据集则无法实现。我们希望CLEVR-Dialog的发现有助于指导未来视觉对话模型的开发。我们的数据集与代码已公开可用。
引用
@article{arxiv.1903.03166,
title = {CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual Dialog},
author = {Satwik Kottur and José M. F. Moura and Devi Parikh and Dhruv Batra and Marcus Rohrbach},
journal= {arXiv preprint arXiv:1903.03166},
year = {2019}
}
备注
13 pages, 11 figures, 3 tables, accepted as a short paper at NAACL 2019