CoTMR:面向免训练零样本组合图像检索的思维链多尺度推理
计算机视觉与模式识别
2025-03-03 v1 信息检索
摘要
零样本组合图像检索(ZS-CIR)旨在无需训练样本的情况下,通过整合来自组合查询(参考图像和修改文本)的信息来检索目标图像。现有方法主要结合描述模型和大型语言模型(LLM)根据组合查询生成目标描述,但面临不兼容、视觉信息丢失和推理不足等各种问题。在这项工作中,我们提出了 CoTMR,一个为 ZS-CIR 精心设计的免训练框架,具有新颖的思维链和多尺度推理。CoTMR 不依赖描述模型进行模态转换,而是采用大型视觉语言模型(LVLM)实现对组合查询的统一理解和推理。为了增强推理的可靠性,我们设计了 CIRCoT,它使用预定义的子任务引导 LVLM 进行逐步推理过程。考虑到现有方法仅关注全局级推理,我们的 CoTMR 引入了多尺度推理,通过在对象尺度上对关键元素的存在与否进行细粒度预测来实现更全面的推理。此外,我们设计了一种多粒度评分(MGS)机制,该机制将上述推理输出与候选图像的 CLIP 相似度得分相结合,以实现精确检索。大量实验表明,我们的 CoTMR 不仅在四个著名基准上大幅超越了先前的方法,而且提供了极具吸引力的可解释性。
引用
@article{arxiv.2502.20826,
title = {CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval},
author = {Zelong Sun and Dong Jing and Zhiwu Lu},
journal= {arXiv preprint arXiv:2502.20826},
year = {2025}
}