中文

探究位置信息在视觉-语言模型中的作用

计算与语言 2023-05-18 v1 计算机视觉与模式识别

摘要

在大多数视觉-语言(VL)模型中,对图像结构的理解是通过注入图像中物体的位置信息(PI)来实现的。在以最先进的 VL 模型 LXMERT 为对象的案例研究中,我们探查了表示中对 PI 的使用,并研究了其对视觉问答(Visual Question Answering)的影响。我们表明,在仅位置不同的挑战集上,该模型无法利用 PI 完成图像-文本匹配任务。然而,我们的探查实验证实 PI 确实存在于表示中。我们提出两种策略来解决此问题:(i)位置信息预训练;(ii)利用跨模态匹配对 PI 进行对比学习。通过这种方式,模型能够正确判断带有详细 PI 陈述的图像是否匹配。除边界框提供的 2D 信息外,我们引入物体深度作为新特征,以在空间中更好地定位物体。尽管我们按照探查所定义的那样改善了模型性质,但这对下游性能仅有可忽略的影响。因此,我们的结果凸显了多模态建模中的一个重要问题:探查分类器可检测到的信息单纯存在,并不能保证该信息在跨模态设置中可用。

关键词

引用

@article{arxiv.2305.10046,
  title  = {Probing the Role of Positional Information in Vision-Language Models},
  author = {Philipp J. Rösch and Jindřich Libovický},
  journal= {arXiv preprint arXiv:2305.10046},
  year   = {2023}
}

备注

Findings of the Association for Computational Linguistics: NAACL 2022, pages 1031-1041, Seattle, United States. Association for Computational Linguistics