中文

QLEVR:一个用于量化语言与基础视觉推理的诊断数据集

计算机视觉与模式识别 2022-05-09 v1 计算与语言

摘要

合成数据集已成功用于探查视觉问答数据集的推理能力。例如,CLEVR (johnson2017clevr) 测试了一系列视觉推理能力。CLEVR 中的问题聚焦于形状、颜色和大小的比较、数值推理以及存在性断言。本文介绍了一个最小偏置的视觉问答诊断数据集 QLEVR,它超越了存在性与数值量化,聚焦于更复杂的量词及其组合,例如询问图像中是否存在多于两个比至少三个蓝色球更小的红色球。我们描述了该数据集的创建过程,并对当前最先进的视觉问答模型进行了首次评估,表明 QLEVR 对我们的现有模型构成了巨大挑战。代码与数据集可在 https://github.com/zechenli03/QLEVR 获取。

关键词

引用

@article{arxiv.2205.03075,
  title  = {QLEVR: A Diagnostic Dataset for Quantificational Language and Elementary Visual Reasoning},
  author = {Zechen Li and Anders Søgaard},
  journal= {arXiv preprint arXiv:2205.03075},
  year   = {2022}
}

备注

To appear at Findings of NAACL 2022