中文

IconQA:面向抽象图表理解与视觉语言推理的新基准

计算机视觉与模式识别 2022-07-26 v4 人工智能 计算与语言 机器学习

摘要

当前的视觉问答(VQA)任务主要考虑为自然图像回答人工标注的问题。然而,除自然图像外,具有语义丰富性的抽象图表在视觉理解与推理研究中仍未被充分探索。在这项工作中,我们引入了一项新的图标问答(IconQA)挑战,目标是在图标图像上下文中回答问题。我们发布了 IconQA,一个包含 107,439 个问题及三个子任务的大规模数据集:多图像选择、多文本选择和填空。IconQA 数据集受现实世界图表文字问题启发,这些问题凸显了抽象图表理解与综合认知推理的重要性。因此,IconQA 不仅要求物体识别与文本理解等感知技能,还要求几何推理、常识推理和算术推理等多样的认知推理技能。为便于潜在的 IconQA 模型学习图标图像的语义表示,我们进一步发布了图标数据集 Icon645,其包含 377 个类别的 645,687 个彩色图标。我们开展了广泛的用户研究与盲实验,并复现了多种先进的 VQA 方法来对 IconQA 任务进行基准测试。此外,我们开发了一个强大的 IconQA 基线 Patch-TRM,其应用了在图标数据集上预训练输入图表嵌入的金字塔跨模态 Transformer。IconQA 与 Icon645 可在 https://iconqa.github.io 获取。

关键词

引用

@article{arxiv.2110.13214,
  title  = {IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning},
  author = {Pan Lu and Liang Qiu and Jiaqi Chen and Tony Xia and Yizhou Zhao and Wei Zhang and Zhou Yu and Xiaodan Liang and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:2110.13214},
  year   = {2022}
}

备注

Corrected typos. Accepted to NeurIPS 2021, 27 pages, 18 figures. Data and code are available at https://iconqa.github.io