中文

Winoground:探查视觉与语言模型的视觉-语言组合性

计算机视觉与模式识别 2022-04-26 v2 计算与语言

摘要

我们提出了一项用于评估视觉与语言模型进行视觉-语言组合推理能力的新任务与数据集,称之为 Winoground。给定两张图像与两个标题,目标是正确地将它们匹配——但关键在于,两个标题包含一组完全相同的词,仅顺序不同。该数据集由专家标注者精心手工整理,并标注了丰富的细粒度标签以辅助分析模型性能。我们探查了多种最先进的视觉与语言模型,并惊讶地发现它们中没有一个表现得明显优于随机猜测。显然,这些模型在视觉-语言组合推理方面并不如我们所期望的那般熟练。我们进行了广泛的分析以获得对未来工作可能尝试缓解这些模型缺陷的见解。我们旨在使 Winoground 作为一个有用的评估集,以推进最先进水平并推动该领域的进一步进展。该数据集可在 https://huggingface.co/datasets/facebook/winoground 获取。

关键词

引用

@article{arxiv.2204.03162,
  title  = {Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality},
  author = {Tristan Thrush and Ryan Jiang and Max Bartolo and Amanpreet Singh and Adina Williams and Douwe Kiela and Candace Ross},
  journal= {arXiv preprint arXiv:2204.03162},
  year   = {2022}
}

备注

CVPR 2022