图文组合检索的鲁棒性基准评测
计算机视觉与模式识别
2023-12-01 v2 信息检索
摘要
图文组合检索旨在通过组合查询检索目标图像,该查询以一张图像加上描述对输入图像所需修改的一些文本的形式给出。由于能够利用信息丰富的图像和简洁的语言来精确表达目标图像的需求,该方法近来受到关注。然而,这些方法的鲁棒性针对真实世界 corruptions(损坏)或进一步的文本理解能力从未被研究过。在本文中,我们进行了首个鲁棒性研究,并建立了三个新的多样化基准,用于系统分析图文组合检索在视觉和文本两方面的自然损坏下的表现,并进一步探查文本理解能力。对于自然损坏分析,我们引入了两个新的大规模基准数据集 CIRR-C 和 FashionIQ-C,分别用于开放域和时尚域的测试,两者均施加了 15 种视觉损坏和 7 种文本损坏。对于文本理解分析,我们通过用合成数据扩展原始原始数据,引入了一个新的诊断数据集 CIRR-D,其包含修改后的文本以更好地探查文本理解能力,包括数值变化、属性变化、物体移除、背景变化和细粒度评估。代码和基准数据集可在 https://github.com/SunTongtongtong/Benchmark-Robustness-Text-Image-Compose-Retrieval 获取。
引用
@article{arxiv.2311.14837,
title = {Benchmarking Robustness of Text-Image Composed Retrieval},
author = {Shitong Sun and Jindong Gu and Shaogang Gong},
journal= {arXiv preprint arXiv:2311.14837},
year = {2023}
}
备注
Accepted by R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023