RoCOCO:面向图像-文本匹配模型压力测试的 MS-COCO 鲁棒性基准
计算机视觉与模式识别
2024-12-23 v5 人工智能
摘要
随着视觉-语言模型在各种下游任务中的广泛使用,评估其鲁棒性至关重要。本文提出一个用于评估视觉-语言模型鲁棒性的基准。我们认为,一个鲁棒的模型应正确理解语言和视觉语义,并对显式变化具有韧性。为实现这一目标,我们在 MS-COCO 测试集中创建了新的文本和图像变体,并使用新数据重新评估了当前最优(SOTA)模型。具体而言,我们通过替换一个词来改变文本含义,并生成视觉上被改变的图像——这些图像在保持某些视觉上下文的同时,通过图像混合技术引入明显的像素变化。我们在所提基准上的评估揭示了许多 SOTA 模型性能的显著下降(例如,图像到文本 Recall@1:BLIP 中 81.9% 48.4%,VSE 中 66.1% 37.6%),且模型常常偏好被改变后的文本/图像而非原始文本/图像。这表明当前的视觉-语言模型难以应对细微变化,且常常无法理解文本和图像的整体上下文。基于这些发现,我们提出语义对比损失和视觉对比损失以学习更鲁棒的嵌入。数据集与代码见 {\url{https://github.com/pseulki/rococo}}。
引用
@article{arxiv.2304.10727,
title = {RoCOCO: Robustness Benchmark of MS-COCO to Stress-test Image-Text Matching Models},
author = {Seulki Park and Daeho Um and Hajung Yoon and Sanghyuk Chun and Sangdoo Yun and Jin Young Choi},
journal= {arXiv preprint arXiv:2304.10727},
year = {2024}
}
备注
Accepted to ECCV Synthetic Data for Computer Vision Workshop (Oral)