中文

ChiQA:一个基于图像的大规模真实世界问答数据集用于多模态理解

计算与语言 2022-08-08 v1 计算机视觉与模式识别

摘要

视觉问答是自然语言与视觉理解中的一项重要任务。然而,在 VQA、CLEVR 等大多数公开视觉问答数据集中,问题是由人类针对给定图像生成的,如“她的眼睛是什么颜色?”。这种众包生成的人类问题相对简单,且有时偏向某些实体或属性。本文介绍一个基于图像的新问答数据集 ChiQA。它包含互联网用户发出的真实世界查询,并结合若干相关开放域图像。系统应判断该图像能否回答此问题。不同于以往 VQA 数据集,这些问题是真实世界、与图像无关的查询,更多样且无偏。相较以往图像检索或图像描述数据集,ChiQA 不仅衡量相关性还衡量可答性,要求更细粒度的视觉与语言推理。ChiQA 包含逾 4 万问题及逾 20 万问题-图像对。每对赋予 2/1/0 三级标签,分别表示完美回答、部分回答与无关。数据分析显示 ChiQA 要求对语言与视觉的深度理解,包括定位、比较与阅读。我们评估了 ALBEF 等多种先进视觉-语言模型,表明 ChiQA 上仍有很大改进空间。

关键词

引用

@article{arxiv.2208.03030,
  title  = {ChiQA: A Large Scale Image-based Real-World Question Answering Dataset for Multi-Modal Understanding},
  author = {Bingning Wang and Feiyang Lv and Ting Yao and Yiming Yuan and Jin Ma and Yu Luo and Haijin Liang},
  journal= {arXiv preprint arXiv:2208.03030},
  year   = {2022}
}

备注

CIKM2022 camera ready version