中文

所剩非右——对比视觉语言模型残留的位置能力缺陷

计算机视觉与模式识别 2023-11-21 v1 计算与语言

摘要

诸如 CLIP 之类的对比视觉语言模型已被发现缺乏空间理解能力。本文通过分析数据集与嵌入空间,探讨这一现象的可能成因。通过聚焦于简单的左右位置关系,我们表明该行为是完全可预测的,即便在大规模数据集下亦然;证明这些关系可利用合成数据进行教学,并展示该方法能很好地泛化至自然图像——提升了在 Visual Genome Relations 上左右关系的性能。

关键词

引用

@article{arxiv.2311.11477,
  title  = {What's left can't be right -- The remaining positional incompetence of contrastive vision-language models},
  author = {Nils Hoehing and Ellen Rushe and Anthony Ventresque},
  journal= {arXiv preprint arXiv:2311.11477},
  year   = {2023}
}