中文

视觉-语言模型能成为好的推测者吗?探索 VLM 的时间与位置推理

计算机视觉与模式识别 2024-01-01 v2 人工智能

摘要

视觉-语言模型(VLMs)被期望能像人类一样用常识知识进行推理。一个例子是,人类可基于自身知识推理图像的拍摄地点与时间。这使我们好奇,基于视觉线索,用大规模图文资源预训练的视觉-语言模型能否达到甚至超越人类在时间与位置推理上的能力。为回答此问题,我们提出一个两阶段\识别\space与\推理\space探测任务,应用于判别式与生成式 VLM,以揭示 VLM 能否识别时间与位置相关特征并进一步推理。为促进研究,我们引入 WikiTiLo,一个精心构建的、含丰富社会文化线索图像的数据集。在大量实验研究中,我们发现尽管 VLM 能在视觉编码器中有效保留相关特征,仍无法做到完美推理。我们将发布数据集与代码以促进未来研究。

关键词

引用

@article{arxiv.2307.06166,
  title  = {Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning},
  author = {Gengyuan Zhang and Yurui Zhang and Kerui Zhang and Volker Tresp},
  journal= {arXiv preprint arXiv:2307.06166},
  year   = {2024}
}

备注

Accepted to WACV 2024