中文

视觉-文本交叉对齐:优化视觉语言模型中的相似度分数

计算机视觉与模式识别 2024-06-06 v1 机器学习

摘要

最近发现,使用预训练的视觉语言模型(VLM,例如CLIP)将整个查询图像与由大型语言模型生成的多个更细粒度的文本描述进行对齐,可以显著提升零样本性能。然而,在本文中,我们通过实验发现,这些更细粒度的描述往往更有效地与查询图像的局部区域而非整个图像对齐,并且我们从理论上验证了这一发现。因此,我们提出了一种称为加权视觉-文本交叉对齐(WCA)的方法。该方法首先采用局部视觉提示技术,旨在识别查询图像中的局部视觉区域。然后,通过使用预训练的VLM创建相似度矩阵,将这些局部视觉区域与更细粒度的描述进行交叉对齐。为了确定查询图像与每个类别的对齐程度,我们基于该矩阵中的加权相似度开发了一个评分函数。大量实验表明,我们的方法在各种数据集上显著提升了零样本性能,取得了甚至可与少样本学习方法相媲美的结果。

关键词

引用

@article{arxiv.2406.02915,
  title  = {Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models},
  author = {Jinhao Li and Haopeng Li and Sarah Erfani and Lei Feng and James Bailey and Feng Liu},
  journal= {arXiv preprint arXiv:2406.02915},
  year   = {2024}
}

备注

22 pages, 16 figures, published to ICML 2024