中文

超越语义搜索:面向组合图像检索的参照锚定

计算机视觉与模式识别 2026-04-08 v1 多媒体

摘要

组合图像检索(CIR)通过结合参考图像和修改文本实现了灵活的多模态查询,展现了巨大的潜力。然而,CIR 本质上侧重语义匹配,在可靠检索用户指定实例 across contexts 方面存在挑战。实际应用中,强调具体实例保真度而非广义语义往往更为重要。本文提出对象锚定组合图像检索(OACIR),一种新型细粒度检索任务,要求严格的实例级一致性。为推动该任务的研究,我们构建了 OACIRR(OACIR on Real-world images),首个规模庞大(超过 16 万个四元组)且包含四个具有挑战性候选画廊的基准数据集,画廊中嵌入难分辨的负样本干扰项。每个四元组为组合查询增添一个边界框,对参考图像中的目标对象进行视觉锚定,为确保实例保真提供了精确且灵活的途径。为解决 OACIR 任务,我们提出 AdaFocal—a 包含情境感知注意力调制器的框架,可在指定的实例区域内自适应强化注意力,动态平衡锚定实例与更广泛组合语境之间的关注。大量实验表明,AdaFocal 在保持实例级保真度方面显著优于现有组合检索模型,从而为这一挑战性任务建立了稳健的基线,同时开启了更灵活、实例感知检索系统的新方向。

关键词

引用

@article{arxiv.2604.05393,
  title  = {Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval},
  author = {Yuxin Yang and Yinan Zhou and Yuxin Chen and Ziqi Zhang and Zongyang Ma and Chunfeng Yuan and Bing Li and Jun Gao and Weiming Hu},
  journal= {arXiv preprint arXiv:2604.05393},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/