中文

ROME:在视觉常识之外推理能力上评估预训练视觉-语言模型

计算与语言 2023-10-31 v1 人工智能 计算机视觉与模式识别

摘要

人类拥有超越常识的强推理能力。例如,给定一张金鱼躺在桌上、旁边为空鱼缸的反常规图像,人类可轻松判断鱼不在鱼缸内。然而,视觉-语言模型的情况可能不同,尽管有视觉输入,其推理仍可能偏向鱼在缸内的常见情景。本文引入一个名为 ROME(超越常识知识的推理)的新型探测数据集,用以评估最先进的预训练视觉-语言模型是否具备正确解读反直觉内容的推理能力。ROME 包含违背有关颜色、形状、材质、尺寸及位置关系的常识知识的图像。在最先进的预训练视觉-语言模型上的实验表明,这些模型大多仍很大程度上无法解读反直觉场景。我们希望 ROME 能推动视觉-语言研究中关于超越常识知识推理的进一步探索。

关键词

引用

@article{arxiv.2310.19301,
  title  = {ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense},
  author = {Kankan Zhou and Eason Lai and Wei Bin Au Yeong and Kyriakos Mouratidis and Jing Jiang},
  journal= {arXiv preprint arXiv:2310.19301},
  year   = {2023}
}

备注

This is the camera-ready version of the paper that will be published in the EMNLP 2023 Findings (Singapore, 6-10 December 2023)