中文

利用分布约束实现可扩展且高效的图像检索

信息检索 2025-04-03 v3

摘要

图像检索是机器人和计算机视觉领域的关键技术,下游应用包括机器人定位和基于视觉的产品推荐。现代检索系统面临两个关键挑战:可扩展性和效率。基于数据集训练特定神经网络的图像检索系统虽在性能上具有优势,但缺乏可扩展性。此外,由于检索速度与嵌入大小直接相关,采用大型嵌入的现有系统效率不高。为解决可扩展性问题,近期研究提出使用即插即用基础模型。然而,这些模型虽可跨数据集应用,但在实现与数据集特定模型相当的性能方面不足。我们的关键观察是,尽管基础模型捕获了有效检索所必需的细微差别,但其嵌入空间的分布可能对余弦相似性搜索产生负面影响。我们引入了强方差约束的自编码器 (AE-SVC),用于投影,可显著提高基础模型的检索性能。我们对 AE-SVC 进行深入的理论分析。为解决效率问题,我们引入了单次相似性空间蒸馏 ((SS)2_2D),这是一种学习可自适应大小嵌入的新方法,可在大小和性能之间提供更好的权衡。在四个检索数据集上进行了大量实验,包括 Stanford Online Products (SoP) 和 Pittsburgh30k,使用四种不同的即插即用基础模型,包括 DinoV2 和 CLIP。AE-SVC 在检索性能上实现了最高可达 16%16\% 的提升,而 (SS)2_2D 对于较小的嵌入大小还能进一步实现 10%10\% 的提升。

关键词

引用

@article{arxiv.2410.07022,
  title  = {Exploiting Distribution Constraints for Scalable and Efficient Image Retrieval},
  author = {Mohammad Omama and Po-han Li and Sandeep P. Chinchali},
  journal= {arXiv preprint arXiv:2410.07022},
  year   = {2025}
}