中文

突出重点:面向属性聚焦图像检索的可提示嵌入

计算机视觉与模式识别 2025-10-15 v2 计算与语言 机器学习

摘要

虽然一张图片的值远胜千言万语,但只有少数文字能为给定任务提供关键信息,因而应当被聚焦。理想的文本到图像(T2I)检索器应优先关注与查询相关的特定视觉属性。为评估当前检索器在处理属性聚焦查询方面的表现,我们构建了 COCO-Facet—a 基于 COCO 数据集的基准,包含 9,112 个关于多样化属性兴趣的查询。我们发现,由于图像嵌入关注全局语义和主体,同时忽略其他细节,CLIP 类检索器——尽管因其高效性和零样本能力而广泛采用——在性能上表现不佳且不均衡。值得注意的是,我们发现即便是最新的多模态大语言模型(MLLM)基于的更强检索器在输出维度更大的情况下,仍难以克服这一局限。因此,我们假设使用通用图像嵌入进行检索对于完成此类查询存在次优问题。作为解决方案,我们提出使用由这些多模态检索器启发的可提示图像嵌入,通过突出所需属性来提升性能。我们提出的管道可 generalization across query types, image pools, and base retriever architectures。为提升实际应用性,我们提供两种加速策略:预处理可提示嵌入和使用线性近似。我们指出前者在查询预定义时可实现 Recall@5 提升 15%,后者在仅在推理时可用提示时可实现 8% 的提升。

关键词

引用

@article{arxiv.2505.15877,
  title  = {Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval},
  author = {Siting Li and Xiang Gao and Simon Shaolei Du},
  journal= {arXiv preprint arXiv:2505.15877},
  year   = {2025}
}

备注

NeurIPS 2025; 27 pages, 6 figures