一个好的 CREPE 需要的不仅仅是 Sugar:探究组合视觉-语言基准中的偏差
计算机视觉与模式识别
2025-06-11 v1
摘要
我们研究了 17 个基准(例如 SugarCREPE、VALSE),这些基准通常用于衡量视觉-语言模型(VLM)的组合理解能力。我们仔细审查了它们构建过程中的设计选择,包括数据源(例如 MS-COCO)和数据筛选程序(例如构建负样本图像/标题),发现大多数基准中存在几种固有偏差。我们发现盲目的启发式方法(例如词元长度、语言模型下的对数似然)的表现与 CLIP 模型相当,这表明这些基准并未有效衡量组合理解能力。我们证明,其潜在因素是由基准构建程序引起的正负样本图像/标题之间的分布不对称。为了缓解这些问题,我们为构建更稳健的视觉-语言组合理解基准提供了一些关键建议,使其不易受到此类简单攻击的影响。
引用
@article{arxiv.2506.08227,
title = {A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks},
author = {Vishaal Udandarao and Mehdi Cherti and Shyamgopal Karthik and Jenia Jitsev and Samuel Albanie and Matthias Bethge},
journal= {arXiv preprint arXiv:2506.08227},
year = {2025}
}