中文

MCoT-MVS:基于多模态链式思考的多级视觉选择用于组合图像检索

计算机视觉与模式识别 2026-03-19 v1

摘要

组合图像检索(CIR)旨在基于参考图像和修改后的文本检索目标图像。然而,现有方法往往难以从参考图像中提取最能反映用户意图在文本修改提示下的语义线索,导致来自无关视觉噪声的干扰。本文提出了一种 novel 多级视觉选择方法,称为多模态链式思考(Multi-modal Chain-of-Thought)视觉选择(MCoT-MVS),用于CIR,将注意力感知的多级视觉特征整合到由多模态大语言模型(MLLM)生成的推理线索中。具体而言,我们利用MLLM对多模态组合输入进行链式思考推理,生成保留项、删除项和目标推断文本。这些文本线索随后指导两个参考注意力选择模块,从参考图像中有选择地提取判别性的patch级和instance级语义。最后,为了有效地将这些多粒度视觉线索与修改文本以及想象的目标描述融合,我们设计了一个加权层次化组合模块,在统一的嵌入空间中将组合查询与目标图像对齐。在两个CIR基准测试(CIRR和FashionIQ)上的大规模实验表明,我们的方法在所有指标上均优于现有方法,实现了新的最佳性能。代码和训练好的模型已公开。

关键词

引用

@article{arxiv.2603.17360,
  title  = {MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval},
  author = {Xuri Ge and Chunhao Wang and Xindi Wang and Zheyun Qin and Zhumin Chen and Xin Xin},
  journal= {arXiv preprint arXiv:2603.17360},
  year   = {2026}
}

备注

Accepted by The Web Conference 2026 (WWW2026)