中文

ECCV Caption:通过收集机器与人工验证的图像-标题关联纠正 MS-COCO 中的假阴性

计算机视觉与模式识别 2024-01-04 v5

摘要

图像-文本匹配(ITM)是评估视觉与语言(VL)模型质量的常见任务。然而,现有的 ITM 基准测试存在一个显著局限:由于数据构建过程本身的原因,它们存在大量缺失的对应关系。例如,一个标题仅与一张图像匹配,尽管该标题可以与其他相似图像匹配,反之亦然。为纠正大量假阴性,我们通过机器和人工标注员补充缺失的关联,构建了扩展 COCO 验证集(ECCV Caption)数据集。我们采用五种具有不同特性的最先进 ITM 模型进行标注过程。与原始 MS-COCO 相比,我们的数据集提供了 3.6 倍的正向图像到标题关联和 8.5 倍的标题到图像关联。我们还提议使用信息量更丰富的基于排序的指标 mAP@R,而非流行的 Recall@K (R@K)。我们在现有和提议的基准测试上重新评估了现有的 25 个 VL 模型。我们的发现表明,现有基准测试(如 COCO 1K R@K、COCO 5K R@K、CxC R@1)彼此高度相关,而当转向 ECCV mAP@R 时,排名会发生变化。最后,我们深入探讨了机器标注员选择所引入偏差的影响。源代码和数据集可在 https://github.com/naver-ai/eccv-caption 获取。

关键词

引用

@article{arxiv.2204.03359,
  title  = {ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCO},
  author = {Sanghyuk Chun and Wonjae Kim and Song Park and Minsuk Chang and Seong Joon Oh},
  journal= {arXiv preprint arXiv:2204.03359},
  year   = {2024}
}

备注

Published in ECCV 2022; 32 pages (2.3MB); Code and dataset: https://github.com/naver-ai/eccv-caption; v5 fixes errors in Table 4: the COCO 1K R@1 numbers were incorrect. All other tables and figures are correct. v5 also adds RSUM scores in Tab 4 and 5: RSUM has a high correlation with COCO 1K recalls; v4 fixes errors in v3 -- see the v4 comment for details