所剩非右——对比视觉语言模型残留的位置能力缺陷
计算机视觉与模式识别
2023-11-21 v1 计算与语言
摘要
诸如 CLIP 之类的对比视觉语言模型已被发现缺乏空间理解能力。本文通过分析数据集与嵌入空间,探讨这一现象的可能成因。通过聚焦于简单的左右位置关系,我们表明该行为是完全可预测的,即便在大规模数据集下亦然;证明这些关系可利用合成数据进行教学,并展示该方法能很好地泛化至自然图像——提升了在 Visual Genome Relations 上左右关系的性能。
引用
@article{arxiv.2311.11477,
title = {What's left can't be right -- The remaining positional incompetence of contrastive vision-language models},
author = {Nils Hoehing and Ellen Rushe and Anthony Ventresque},
journal= {arXiv preprint arXiv:2311.11477},
year = {2023}
}