对比区域引导:无需训练即可提升视觉 - 语言模型中的定位能力
摘要
突出图像中特别相关的区域可以通过引导模型更紧密地关注这些感兴趣区域,从而提高视觉 - 语言模型 (VLMs) 在各种视觉 - 语言 (VL) 任务中的性能。例如,可以为 VLMs 提供“视觉提示”,其中边界框等视觉标记勾勒出关键图像区域。然而,当前能够整合视觉引导的 VLMs 要么是专有的且昂贵,要么需要在包含视觉提示的精选数据上进行昂贵的训练。我们引入了对比区域引导 (CRG),这是一种无需训练的引导方法,使开源 VLMs 能够响应视觉提示。CRG 对比了有无视觉提示时产生的模型输出,剔除了模型在回答缺乏产生正确答案所需信息(即模型的先验)时所表现出的偏差。CRG 在多种 VL 任务中取得了显著改进:当提供区域标注时,CRG 在 ViP-Bench(包含识别、数学和物体关系推理等六个不同基于区域的任务集合)上将绝对准确率提高了多达 11.1%。我们还展示了 CRG 在空间推理(在 What'sUp 上提高 10%)和组合泛化(在 SugarCrepe 的两个具有挑战性的分割上将准确率分别提高 11.5% 和 7.5%)以及生成图像的图文对齐(在 SeeTRUE 上将 AUROC 提高多达 8.4,F1 分数提高 6.8)方面的适用性。当参考区域缺失时,CRG 允许我们在 RefCOCO/+/g 和 Flickr30K Entities 等指代表达式理解和短语定位基准中对提议的区域进行重新排序,平均准确率增益为 3.2%。我们的分析探讨了 CRG 的替代掩码策略,量化了 CRG 的概率偏移,并评估了区域引导强度的作用,从而实证验证了 CRG 的设计选择。
引用
@article{arxiv.2403.02325,
title = {Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training},
author = {David Wan and Jaemin Cho and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2403.02325},
year = {2024}
}
备注
Project website: https://contrastive-region-guidance.github.io/