推理时添加简单结构提升视觉-语言组合性
计算机视觉与模式识别
2025-06-12 v1 计算与语言
机器学习
摘要
双编码器视觉-语言模型(VLM)如CLIP广泛用于图像-文本检索任务。然而,这些模型在组合性方面存在困难,表现出类似词袋的行为,限制了其检索性能。许多不同的训练方法已被提出以改善这些模型的视觉-语言组合性能力。相比之下,推理时技术很少受到关注。在本文中,我们提出在推理时添加简单结构,即给定一张图像和一段字幕:i)将图像划分为不同的较小裁剪块,ii)提取文本片段,捕获物体、属性和关系,iii)使用VLM找到与文本片段更好对齐的图像裁剪块以获得匹配,iv)通过聚合各个匹配的相似度来计算最终的图像-文本相似度。基于各种流行的双编码器VLM,我们在受控和自然数据集上评估了我们方法在视觉-语言组合性方面的表现。我们发现我们的方法在不进行任何训练的情况下持续提升了所评估VLM的性能,这展示了推理时技术的潜力。在受控数据集上,属性-物体绑定的结果尤其好。通过广泛的分析:i)我们表明处理图像裁剪块对于观察到的性能提升至关重要,ii)我们识别了进一步改进推理时方法的具体方向。
引用
@article{arxiv.2506.09691,
title = {Adding simple structure at inference improves Vision-Language Compositionality},
author = {Imanol Miranda and Ander Salaberria and Eneko Agirre and Gorka Azkune},
journal= {arXiv preprint arXiv:2506.09691},
year = {2025}
}