中文

通过可学习属性权重和目标相对负采样构建独特查询嵌入的 DQE-CIR:用于组合图像检索

计算机视觉与模式识别 2026-03-05 v1 人工智能 机器学习

摘要

组合图像检索(CIR)解决了通过联合解释参考图像和指定意图更改的修改文本来检索目标图像的问题。大多数现有方法仍基于对比学习框架构建,将ground truth 图像视为唯一的正实例,将所有剩余图像视为负实例。这种策略不可避免地引入相关性抑制,其中语义上相关但有效的图像被错误地推远,以及语义混淆,其中不同的修改意图坍缩到嵌入空间的重叠区域。结果是,所学查询表示往往缺乏区分性,尤其是在细粒度属性更改方面。为克服这些限制,我们提出了通过可学习属性权重和目标相对负采样构建独特查询嵌入(DQE-CIR),一种旨在通过显式建模目标相对相关性来学习独特查询嵌入的方法。DQE-CIR 包含可学习的属性加权,以在修改文本条件下强调独特视觉特征,实现语言和视觉之间更精确的特征对齐。此外,我们引入目标相对负采样,该方法构建目标相对相似度分布,并从排除易负样本和模糊假负样本的中间区域中选择信息丰富的负样本。该策略通过改进查询的区分性和减少由语义上相似但无关的候选者引起的混淆,实现了对细粒度属性更改的可靠检索。

关键词

引用

@article{arxiv.2603.04037,
  title  = {DQE-CIR: Distinctive Query Embeddings through Learnable Attribute Weights and Target Relative Negative Sampling in Composed Image Retrieval},
  author = {Geon Park and Ji-Hoon Park and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2603.04037},
  year   = {2026}
}

备注

33 pages