图像集合上的视觉问答
计算机视觉与模式识别
2020-08-28 v1
摘要
我们提出了图像集合视觉问答(ISVQA)任务,它将通常研究的单图像 VQA 问题推广到多图像设定。该任务以自然语言问题和一组图像作为输入,旨在基于图像内容回答问题。问题可以关于一张或多张图像中的对象与关系,也可以关于由该图像集合描绘的整个场景。为支持这一新主题的研究,我们引入了两个 ISVQA 数据集——室内与室外场景。它们分别模拟了室内图像采集与多车载摄像头的真实世界场景。室内场景数据集包含 48,138 个图像集上的 91,479 个人工标注问题,室外场景数据集包含 12,746 个图像集上的 49,617 个问题。我们分析了两个数据集的性质,包括问答分布、问题类型、数据集偏差以及问题-图像依赖关系。我们还构建了新基线模型以探究 ISVQA 中的新研究挑战。
引用
@article{arxiv.2008.11976,
title = {Visual Question Answering on Image Sets},
author = {Ankan Bansal and Yuting Zhang and Rama Chellappa},
journal= {arXiv preprint arXiv:2008.11976},
year = {2020}
}
备注
Conference paper at ECCV 2020