中文

SugarCrepe:修复视觉-语言组合性基准中的可攻击漏洞

计算机视觉与模式识别 2023-06-27 v1 计算与语言 机器学习

摘要

仅去年一年,大量用于衡量视觉-语言模型组合性理解的新基准便已渗透机器学习生态。给定一幅图像,这些基准探查模型从一组组合性干扰项中识别其关联描述的能力。令人惊讶的是,我们发现所有这些基准均存在显著偏差,使其可被轻易攻击。这种可攻击性极为严重,以至于无法访问图像的盲模型表现优于最先进的视觉-语言模型。为补救这一普遍漏洞,我们引入SugarCrepe,一种用于视觉-语言组合性评估的新基准。我们采用大语言模型(而非先前基准中使用的基于规则的模板)生成流畅且合理的困难负样本,并利用对抗式精炼机制最大程度降低偏差。我们重新评估了最先进模型及近期提出的组合性诱导策略,发现其改进被严重高估,表明这一重要方向尚需更多创新。我们在 https://github.com/RAIVNLab/sugar-crepe 发布SugarCrepe及评估代码。

关键词

引用

@article{arxiv.2306.14610,
  title  = {SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality},
  author = {Cheng-Yu Hsieh and Jieyu Zhang and Zixian Ma and Aniruddha Kembhavi and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2306.14610},
  year   = {2023}
}