视觉语言模型理解复合名词吗?
计算机视觉与模式识别
2024-04-02 v1 计算与语言
摘要
像 CLIP 这样使用对比损失训练的开放词汇视觉语言模型(VLMs),已成为文本到图像检索的一种有前途的新范式。然而,VLMs 对复合名词(CNs)(例如 lab coat)的理解是否和对普通名词(例如 lab)一样好呢?我们整理了 Compun,一个包含 400 个独特且常用的复合名词的新基准,以评估 VLMs 在解释复合名词方面的有效性。Compun 基准对 VLM 提出了文本到图像检索的挑战,给定一个包含复合名词的文本提示,任务是在一对显示构成该复合名词的组成名词的干扰图像中,选择显示该复合名词的正确图像。接下来,我们进行了深入分析,以突出 CLIP 对某些类型复合名词理解的局限性。最后,我们提出了一个替代框架,超越了 CLIP 类模型广泛使用的手写文本提示模板。我们利用大型语言模型生成多个多样化的描述,这些描述将复合名词作为描述场景中的对象包含在内。我们提出的方法在 Compun 上将 CLIP 的复合名词理解能力提高了 8.25%。代码和基准可在以下网址获取:https://github.com/sonalkum/Compun
引用
@article{arxiv.2404.00419,
title = {Do Vision-Language Models Understand Compound Nouns?},
author = {Sonal Kumar and Sreyan Ghosh and S Sakshi and Utkarsh Tyagi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2404.00419},
year = {2024}
}
备注
Accepted to NAACL 2024 Main Conference