中文

Winoground为何困难?探究视觉语言组合性中的失败

计算与语言 2022-12-06 v4 计算机视觉与模式识别

摘要

近期的视觉语言预训练模型在图像检索和视频描述等多种末端任务上展现出可喜进展。然而,它们在最近提出的Winoground数据集上表现极差,该数据集要求模型将成对图像与英文描述相匹配,其中的条目在词法上重叠但在语义上不同(例如“草丛中有个杯子”与“杯子里有些草”)。通过使用新的细粒度标签对数据集进行标注,我们表明解决Winoground任务不仅需要组合性语言理解,还需要一系列其他能力,如常识推理或在低分辨率图像中定位小的、失焦的物体。在本文中,我们通过在相关任务(探测任务、图像检索任务)上的一系列实验、数据增强以及对数据集的手动检查,识别出该数据集的主要挑战。我们的分析表明,视觉语言模型的一个主要挑战可能在于融合视觉与文本表示,而非组合性语言理解。我们在 https://github.com/ajd12342/why-winoground-hard 发布了我们的标注与代码。

关键词

引用

@article{arxiv.2211.00768,
  title  = {Why is Winoground Hard? Investigating Failures in Visuolinguistic Compositionality},
  author = {Anuj Diwan and Layne Berry and Eunsol Choi and David Harwath and Kyle Mahowald},
  journal= {arXiv preprint arXiv:2211.00768},
  year   = {2022}
}

备注

Accepted at EMNLP 2022. We release our annotation and code at https://github.com/ajd12342/why-winoground-hard . 15 pages, 3 figures