查询自适应检索改进 QuARI
计算机视觉与模式识别
2025-05-29 v1 机器学习
摘要
大规模预训练使视觉语言模型在广泛领域内变得流行,用于图像到图像和文本到图像检索。然而,这些模型在用于挑战性检索任务(如非常大规模图像集合中的实例检索)时表现不佳。最近的工作表明,针对实例检索训练的 VLM 特征的线性变换可通过强化与感兴趣领域相关的子空间来提高性能。本文探索了这种专业化的更激进版本,通过学习将给定查询映射到查询特定特征空间变换。由于该变换是线性的,因此可以最小计算成本应用于数百万图像嵌入,使其对大规模检索或重新排序有效。结果表明,该方法持续优于最先进的替代方案,包括那些在查询时间需要数个数量级更多计算的方案。
引用
@article{arxiv.2505.21647,
title = {QuARI: Query Adaptive Retrieval Improvement},
author = {Eric Xing and Abby Stylianou and Robert Pless and Nathan Jacobs},
journal= {arXiv preprint arXiv:2505.21647},
year = {2025}
}
备注
13 pages, 4 figures, 4 tables