中文

图像-文本检索的基准粒度与模型鲁棒性

计算机视觉与模式识别 2025-06-10 v4 人工智能 信息检索

摘要

图像-文本检索(ITR)系统是多模态信息获取的核心,视觉语言模型(VLM)在标准基准测试上表现突出。然而,这些基准测试主要依赖粗粒度注释,限制了其在真实世界条件下(查询粒度变化)的表现。为弥补这一差距,我们检验了数据集粒度和查询扰动对四种不同架构VLM(ALIGN、AltCLIP、CLIP和GroupViT)检索性能和鲁棒性的影响。我们使用标准基准测试(MS-COCO、Flickr30k)及其细粒度变体,发现更丰富的标题 consistently 提升检索效果,尤其是在文本到图像任务中,平均提升16.23%,而图像到文本仅提升6.44%。为评估鲁棒性,我们引入了扰动分类法并开展大量实验,揭示虽然扰动通常会降低性能,但也可能意外提升检索,暴露出模型的细微行为。值得注意的是,词序成为关键因素——与此前关于模型对其不敏感的假设相矛盾。我们的结果凸显不同模型鲁棒性差异,以及标题粒度与扰动灵敏度之间的数据集相关关系,并强调在不同粒度的数据集上评估模型的必要性。

关键词

引用

@article{arxiv.2407.15239,
  title  = {Benchmark Granularity and Model Robustness for Image-Text Retrieval},
  author = {Mariya Hendriksen and Shuo Zhang and Ridho Reinanda and Mohamed Yahya and Edgar Meij and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2407.15239},
  year   = {2025}
}

备注

accepted at SIGIR 2025