C-VQA:视觉问答(VQA) v1.0数据集的组合拆分
计算机视觉与模式识别
2017-04-27 v1 人工智能
计算与语言
机器学习
摘要
视觉问答 (VQA) 在过去几年中备受关注。针对该任务已提出多种深度学习模型。然而,研究表明这些模型严重受训练数据中表面相关性的驱动,且缺乏组合性——即回答关于已见概念之未见组合问题的能力。这种组合性是值得追求的,且是智能的核心。本文中,我们提出一种新的视觉问答设定,其中测试问答对相比训练问答对在组合上是新颖的。为便于在此设定下开发模型,我们给出了 VQA v1.0 数据集的一种新组合拆分,称之为组合式 VQA (C-VQA)。我们分析了 C-VQA 拆分中问题与答案的分布。最后,我们在这一新设定下评估了若干现有 VQA 模型,表明这些模型的性能相比原始 VQA 设定有显著下降。
引用
@article{arxiv.1704.08243,
title = {C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset},
author = {Aishwarya Agrawal and Aniruddha Kembhavi and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1704.08243},
year = {2017}
}