QuRe:通过组成图像检索中的硬负采样实现查询相关检索
计算机视觉与模式识别
2025-07-17 v1 人工智能
摘要
组成图像检索(CIR)基于参考图像和描述所需修改的文字描述来检索相关图像。然而,现有 CIR 方法仅聚焦于检索目标图像,忽略了其他图像的相关性。这一局限源于大多数采用对比学习的方法——将目标图像视为正样本,将 batch 中的所有其他图像视为负样本——可能无意中引入假负样本。这可能导致检索到不相关的图像,降低用户满意度,即便目标图像被正确检索。为此,我们提出 Query-Relevant Retrieval through Hard Negative Sampling(QuRe),通过优化奖励模型目标来减少假负样本。此外,我们引入硬负采样策略,筛选目标图像之后 relevance 分数呈两次陡峐下降之间的位置的图像,以有效过滤假负样本。为评估 CIR 模型是否符合人类满意度,我们创建了 Human-Preference FashionIQ(HP-FashionIQ)数据集,显式捕捉用户对目标检索之外的偏好。大量实验表明,QuRe 在 FashionIQ 和 CIRR 数据集上实现最先进性能,并在 HP-FashionIQ 数据集上展现出最强的人类偏好对齐能力。源码已公开于 https://github.com/jackwaky/QuRe。
引用
@article{arxiv.2507.12416,
title = {QuRe: Query-Relevant Retrieval through Hard Negative Sampling in Composed Image Retrieval},
author = {Jaehyun Kwak and Ramahdani Muhammad Izaaz Inhar and Se-Young Yun and Sung-Ju Lee},
journal= {arXiv preprint arXiv:2507.12416},
year = {2025}
}
备注
Accepted to ICML 2025