CIR-CoT:基于端到端链路思考推理的可解释组成图像检索
计算机视觉与模式识别
2025-10-10 v1
摘要
组成图像检索 (CIR) 旨在从参考图像和修改文本中寻找目标图像,核心挑战在于在视觉与语义模态之间执行统一推理。虽然基于视觉语言模型 (VLM,如 CLIP) 和更近期的多模态大语言模型 (MLLM,如 Qwen-VL) 的方法取得了进展,但它们主要以 "黑盒" 形式工作。这一内在不透明性不仅阻止用户理解检索逻辑,还限制了模型遵循复杂、细粒度指令的能力。为此,我们引入 CIR-CoT,首个集成显式链路思考 (CoT) 推理的端到端检索导向 MLLM。通过迫使模型首先生成可解释的推理链,CIR-CoT 增强了其捕捉关键跨模态交互的能力,从而在提高检索准确性的同时使决策过程透明化。由于现有数据集如 FashionIQ 和 CIRR lacks 必要的推理数据,我们工作的关键贡献之一是使用包含描述、推理和结论三个阶段的结构化 CoT 标注过程创建数据集。随后,我们对模型进行微调,使其能够生成此类结构化输出,随后将最终检索意图编码到专用嵌入中。综合实验表明,CIR-CoT 在针对性数据集 (FashionIQ、CIRR) 上实现高度具竞争力的性能,并在非针对性 CIRCO 数据集上展现出显著的泛化能力,为更有效可信的检索系统开辟了新道路。
引用
@article{arxiv.2510.08003,
title = {CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning},
author = {Weihuang Lin and Yiwei Ma and Jiayi Ji and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2510.08003},
year = {2025}
}