中文

Paparazzi:深入探究语言与视觉模型在视角描述 grounding 中的能力

计算机视觉与模式识别 2023-02-22 v1 人工智能 计算与语言 机器学习

摘要

现有的语言与视觉模型在图像-文本理解中取得了令人印象深刻的性能。然而,它们在多大程度上可用于 3D 环境中的语言理解,以及它们是否隐式地获得了 3D 物体知识(例如关于物体的不同视图),仍是一个开放问题。在本文中,我们研究最先进的语言与视觉模型 CLIP 是否能够 grounding 3D 物体的透视描述,并基于文本查询识别常见物体的规范视图。我们提出了一个评估框架,该框架使用围绕 3D 物体环绕的相机从不同视角生成图像,并根据其与自然语言描述的相似度进行评估。我们发现预训练的 CLIP 模型在大多数规范视图上表现不佳,而使用难负样本采样和随机对比进行微调即使在可用训练数据很少的条件下也能取得良好结果。

关键词

引用

@article{arxiv.2302.10282,
  title  = {Paparazzi: A Deep Dive into the Capabilities of Language and Vision Models for Grounding Viewpoint Descriptions},
  author = {Henrik Voigt and Jan Hombeck and Monique Meuschke and Kai Lawonn and Sina Zarrieß},
  journal= {arXiv preprint arXiv:2302.10282},
  year   = {2023}
}