中文

基于局部概念重排序的免训练零样本组合图像检索

计算机视觉与模式识别 2024-03-26 v2

摘要

组合图像检索旨在通过参考图像及其对应修改文本构成的组合查询,从图库图像中检索目标图像。由于信息丰富的图像与简洁语言的协同能够精确表达目标图像的需求,该方法近期备受关注。当前大多数组合图像检索方法遵循监督学习方法,在由参考图像、修改文本和对应目标图像组成且构建成本高昂的三元组数据集上进行训练。为了避免难以获取的标注三元组训练数据,零样本组合图像检索 (ZS-CIR) 应运而生,其旨在通过从图像-文本对(自监督三元组)中学习来检索目标图像,而无需人工标注的三元组。然而,这种自监督三元组学习方法在计算上效率较低且缺乏可解释性,因为它假设图像与文本之间的交互是通过隐式查询嵌入进行的,没有显式的语义解释。在本工作中,我们提出了一种新的免训练零样本组合图像检索方法,该方法将查询转换为人类可理解的显式文本。这有助于提高模型学习效率,从而增强基础模型的泛化能力。此外,我们引入了局部概念重排序 (LCR) 机制,以聚焦于从修改指令中提取的判别性局部信息。在四个 ZS-CIR 基准上的大量实验表明,我们的方法取得了与基于三元组训练的 SOTA 方法相当的性能,但在开放领域数据集 (CIRR、CIRCO 和 COCO) 以及时尚领域数据集 (FashionIQ) 上显著优于其他免训练方法。

关键词

引用

@article{arxiv.2312.08924,
  title  = {Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking},
  author = {Shitong Sun and Fanghua Ye and Shaogang Gong},
  journal= {arXiv preprint arXiv:2312.08924},
  year   = {2024}
}

备注

Under Review