中文

CLEVR-X:用于自然语言解释的可视化推理数据集

计算机视觉与模式识别 2022-04-06 v1 计算与语言

摘要

在视觉问答(VQA)背景下提供解释是机器学习中的一个基本问题。为深入洞察 VQA 自然语言解释的生成过程,我们引入了大规模 CLEVR-X 数据集,其在 CLEVR 数据集基础上扩展了自然语言解释。对于 CLEVR 数据集中的每个图像-问题对,CLEVR-X 包含多个由原始场景图导出的结构化文本解释。通过构建,CLEVR-X 解释是正确的,并描述了回答给定问题所需的推理与视觉信息。我们进行了用户研究以确认所提数据集中的真值解释确实完整且相关。我们给出了使用两个最先进框架在 CLEVR-X 数据集上生成 VQA 自然语言解释的基线结果。此外,我们提供了针对不同问题与答案类型的解释生成质量的详细分析。另外,我们研究了使用不同数量真值解释对自然语言生成(NLG)指标收敛的影响。CLEVR-X 数据集公开于 \url{https://explainableml.github.io/CLEVR-X/}。

关键词

引用

@article{arxiv.2204.02380,
  title  = {CLEVR-X: A Visual Reasoning Dataset for Natural Language Explanations},
  author = {Leonard Salewski and A. Sophia Koepke and Hendrik P. A. Lensch and Zeynep Akata},
  journal= {arXiv preprint arXiv:2204.02380},
  year   = {2022}
}