稍微多一点:基于视觉语言模型的文本到图像检索及相关反馈
计算机视觉与模式识别
2025-11-24 v1 信息检索
摘要
大型视觉语言模型 (VLMs) 使使用自然语言查询进行直观的视觉搜索成为可能。然而,提高其性能通常需要微调并扩展到更大的模型变体。在本工作中,我们提出了一种受传统文本搜索启发的机制,用于在推理时提高检索性能:相关反馈。虽然相关反馈可作为微调的替代方案,但其 model-agnostic 设计也使其能够与微调后的 VLMs 一起使用。具体而言,我们引入并评估了四种反馈策略用于 VLM-based 检索。首先,我们修订了经典的伪相关反馈 (PRF),该方法根据 top-ranked results 细化查询嵌入。为解决其局限性,我们提出了生成式相关反馈 (GRF),该方法使用合成标题进行查询细化。此外,我们引入了注意力反馈汇总器 (AFS),是一个定制的基于 Transformer 的模型,用于整合来自相关项的多模态细粒度特征。最后,我们使用 ground-truth 标题模拟显式反馈作为上限基准。在 Flickr30k 和 COCO 上的实验显示,GRF、AFS 和显式反馈相对于没有反馈的检索,在小型 VLMs 上将 MRR@5 提升 3-5%,在大型 VLMs 上提升 1-3%。此外,AFS 类似于显式反馈,可缓解查询漂移,在迭代的多轮检索设置下比 GRF 更稳健。我们的发现表明,相关反馈可以持续地增强检索性能,并为交互式和自适应视觉搜索开辟了机遇。
引用
@article{arxiv.2511.17255,
title = {A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback},
author = {Bulat Khaertdinov and Mirela Popa and Nava Tintarev},
journal= {arXiv preprint arXiv:2511.17255},
year = {2025}
}
备注
Accepted to WACV'26