中文

RoCOCO:面向图像-文本匹配模型压力测试的 MS-COCO 鲁棒性基准

计算机视觉与模式识别 2024-12-23 v5 人工智能

摘要

随着视觉-语言模型在各种下游任务中的广泛使用,评估其鲁棒性至关重要。本文提出一个用于评估视觉-语言模型鲁棒性的基准。我们认为,一个鲁棒的模型应正确理解语言和视觉语义,并对显式变化具有韧性。为实现这一目标,我们在 MS-COCO 测试集中创建了新的文本和图像变体,并使用新数据重新评估了当前最优(SOTA)模型。具体而言,我们通过替换一个词来改变文本含义,并生成视觉上被改变的图像——这些图像在保持某些视觉上下文的同时,通过图像混合技术引入明显的像素变化。我们在所提基准上的评估揭示了许多 SOTA 模型性能的显著下降(例如,图像到文本 Recall@1:BLIP 中 81.9% \rightarrow 48.4%,VSE\infty 中 66.1% \rightarrow 37.6%),且模型常常偏好被改变后的文本/图像而非原始文本/图像。这表明当前的视觉-语言模型难以应对细微变化,且常常无法理解文本和图像的整体上下文。基于这些发现,我们提出语义对比损失和视觉对比损失以学习更鲁棒的嵌入。数据集与代码见 {\url{https://github.com/pseulki/rococo}}。

关键词

引用

@article{arxiv.2304.10727,
  title  = {RoCOCO: Robustness Benchmark of MS-COCO to Stress-test Image-Text Matching Models},
  author = {Seulki Park and Daeho Um and Hajung Yoon and Sanghyuk Chun and Sangdoo Yun and Jin Young Choi},
  journal= {arXiv preprint arXiv:2304.10727},
  year   = {2024}
}

备注

Accepted to ECCV Synthetic Data for Computer Vision Workshop (Oral)