使用联合嵌入个性化检索或“Fluffy 的回归”
计算机视觉与模式识别
2025-10-08 v1
摘要
本文的目标是能够使用复合查询检索图像,该复合查询将来自图像的物体实例信息与关于该物体在做什么或位于何处的自然文本描述相结合。例如,检索一张“独角兽 Fluffy(由图像指定)在某人头上的图像”。为实现这一点,我们设计了一个映射网络,能够将局部图像嵌入(物体实例的)“翻译”为文本 token,使得该 token 与自然语言查询的组合适用于 CLIP 风格的文本编码和图像检索。以这种方式生成文本 token 涉及一个简单的训练过程,只需对每个物体实例执行一次。我们表明,我们使用可训练映射网络(称为 pi-map)结合冻结的 CLIP 文本和图像编码器的方法,在两个旨在评估个性化检索的基准上改进了当前最优水平。
引用
@article{arxiv.2510.05411,
title = {Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"},
author = {Bruno Korbar and Andrew Zisserman},
journal= {arXiv preprint arXiv:2510.05411},
year = {2025}
}
备注
Published as an oral in CBMI2025