SugarCrepe:修复视觉-语言组合性基准中的可攻击漏洞
计算机视觉与模式识别
2023-06-27 v1 计算与语言
机器学习
摘要
仅去年一年,大量用于衡量视觉-语言模型组合性理解的新基准便已渗透机器学习生态。给定一幅图像,这些基准探查模型从一组组合性干扰项中识别其关联描述的能力。令人惊讶的是,我们发现所有这些基准均存在显著偏差,使其可被轻易攻击。这种可攻击性极为严重,以至于无法访问图像的盲模型表现优于最先进的视觉-语言模型。为补救这一普遍漏洞,我们引入SugarCrepe,一种用于视觉-语言组合性评估的新基准。我们采用大语言模型(而非先前基准中使用的基于规则的模板)生成流畅且合理的困难负样本,并利用对抗式精炼机制最大程度降低偏差。我们重新评估了最先进模型及近期提出的组合性诱导策略,发现其改进被严重高估,表明这一重要方向尚需更多创新。我们在 https://github.com/RAIVNLab/sugar-crepe 发布SugarCrepe及评估代码。
引用
@article{arxiv.2306.14610,
title = {SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality},
author = {Cheng-Yu Hsieh and Jieyu Zhang and Zixian Ma and Aniruddha Kembhavi and Ranjay Krishna},
journal= {arXiv preprint arXiv:2306.14610},
year = {2023}
}