WISER:用于训练免费零样态组合图像检索的更广搜索、更深思考与自适应融合
计算机视觉与模式识别
2026-03-25 v4
摘要
零样态组合图像检索 (ZS-CIR) 旨在给定包含参考图像和修改文本的多模态查询(无需在带注释三元组上进行训练)检索目标图像。现有方法通常将多模态查询转换为单一模态——要么作为编辑后的标题用于文本到图像检索 (T2I),要么作为编辑后的图像用于图像到图像检索 (I2I)。然而,每种范式都存在固有的局限性:T2I 常常丢失细粒度视觉细节,而 I2I 在处理复杂语义修改时则难以胜任。为有效利用其互补优势并应对多样化查询意图,我们提出 WISER,一个训练免费的框架,通过“检索-验证-精炼”管道统一 T2I 和 I2I,显式建模意图意识和不确定性意识。具体而言,WISER 首先进行更广的搜索,通过生成编辑后的标题和图像进行并行检索以扩大候选池。随后,它通过验证器进行自适应融合,以评估检索置信度,对不确定的检索结果进行精炼,并动态融合双路径以实现可靠检索。对于不确定的检索结果,WISER 通过结构化自反思生成精炼建议,以引导下一轮检索走向更深入的思考。大量实验表明,WISER 在多个基准测试上显著优于现有方法,在 CIRCO (mAP@5) 上的提升达 45%,在 CIRR (Recall@1) 上的提升达 57%,甚至超过许多依赖训练的方法,凸显其在多场景下的优越性和广泛性。代码将在 https://github.com/Physicsmile/WISER 发布。
引用
@article{arxiv.2602.23029,
title = {WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval},
author = {Tianyue Wang and Leigang Qu and Tianyu Yang and Xiangzhao Hao and Yifan Xu and Haiyun Guo and Jinqiao Wang},
journal= {arXiv preprint arXiv:2602.23029},
year = {2026}
}
备注
Accept to CVPR 2026