重新审视基于CLIP的交互式图像检索中的相关性反馈
计算机视觉与模式识别
2024-09-25 v3
摘要
许多图像检索研究使用度量学习来训练图像编码器。然而,度量学习无法处理用户偏好差异,且需要数据来训练图像编码器。为克服这些限制,我们重新审视了经典的相关性反馈技术,用于交互式检索系统,并提出一种结合CLIP与相关性反馈的交互式图像检索系统。我们的检索系统首先执行检索,通过二元反馈收集每个用户的独特偏好,并返回用户偏好的图像。即使用户具有各种偏好,我们的检索系统也通过反馈学习每个用户的偏好并适应该偏好。此外,我们的检索系统利用CLIP的零样本可迁移性,在无需训练的情况下实现高准确率。我们经验性地表明,我们的检索系统在基于类别的图像检索中,尽管未为每个数据集专门训练图像编码器,却与最先进的度量学习方法相抗衡。此外,我们设置了两个额外的实验场景,其中用户具有各种偏好:一种基于单标签的图像检索和受条件图像检索。在这两种情况下,我们的检索系统有效地适应每个用户的偏好,相对于没有反馈的图像检索实现了更好的准确率。总体而言,我们的工作凸显了将CLIP与经典相关性反馈技术相结合的潜在优势,以提高图像检索。
引用
@article{arxiv.2404.16398,
title = {Revisiting Relevance Feedback for CLIP-based Interactive Image Retrieval},
author = {Ryoya Nara and Yu-Chieh Lin and Yuji Nozawa and Youyang Ng and Goh Itoh and Osamu Torii and Yusuke Matsui},
journal= {arXiv preprint arXiv:2404.16398},
year = {2024}
}
备注
Accepted to ECCV 2024 Workshops: 2nd Workshop on Traditional Computer Vision in the Age of Deep Learning (TradiCV)