图像-文本检索的基准粒度与模型鲁棒性
计算机视觉与模式识别
2025-06-10 v4 人工智能
信息检索
摘要
图像-文本检索(ITR)系统是多模态信息获取的核心,视觉语言模型(VLM)在标准基准测试上表现突出。然而,这些基准测试主要依赖粗粒度注释,限制了其在真实世界条件下(查询粒度变化)的表现。为弥补这一差距,我们检验了数据集粒度和查询扰动对四种不同架构VLM(ALIGN、AltCLIP、CLIP和GroupViT)检索性能和鲁棒性的影响。我们使用标准基准测试(MS-COCO、Flickr30k)及其细粒度变体,发现更丰富的标题 consistently 提升检索效果,尤其是在文本到图像任务中,平均提升16.23%,而图像到文本仅提升6.44%。为评估鲁棒性,我们引入了扰动分类法并开展大量实验,揭示虽然扰动通常会降低性能,但也可能意外提升检索,暴露出模型的细微行为。值得注意的是,词序成为关键因素——与此前关于模型对其不敏感的假设相矛盾。我们的结果凸显不同模型鲁棒性差异,以及标题粒度与扰动灵敏度之间的数据集相关关系,并强调在不同粒度的数据集上评估模型的必要性。
引用
@article{arxiv.2407.15239,
title = {Benchmark Granularity and Model Robustness for Image-Text Retrieval},
author = {Mariya Hendriksen and Shuo Zhang and Ridho Reinanda and Mohamed Yahya and Edgar Meij and Maarten de Rijke},
journal= {arXiv preprint arXiv:2407.15239},
year = {2025}
}
备注
accepted at SIGIR 2025