中文

用于图像检索任务的思维链重排序

计算机视觉与模式识别 2025-09-19 v1 信息检索

摘要

图像检索仍然是计算机视觉中一个基础而具有挑战性的问题。尽管多模态大语言模型 (MLLMs) 的最新进展展示了强大的推理能力,但现有方法通常仅将其用于评估,而未让它们直接参与排序过程。因此,它们丰富的多模态推理能力仍未得到充分利用,导致性能不佳。在本文中,我们提出了一种新的思维链重排序 (CoTRR) 方法来解决这一问题。具体而言,我们设计了一个列表式排序提示,使 MLLM 能够直接参与候选图像的重排序。该排序过程基于一个图像评估提示,用于评估每个候选图像与用户查询的匹配程度。通过让 MLLM 执行列表式推理,我们的方法支持全局比较、一致推理和可解释决策——所有这些对于准确的图像检索都至关重要。为了实现结构化和细粒度的分析,我们进一步引入了一个查询分解提示,将原始查询分解为多个语义组件。在五个数据集上的广泛实验证明了我们的 CoTRR 方法的有效性,该方法在三个图像检索任务上达到了最先进的性能,包括文本到图像检索 (TIR)、组合图像检索 (CIR) 和基于聊天的图像检索 (Chat-IR)。我们的代码可在 https://github.com/freshfish15/CoTRR 获取。

关键词

引用

@article{arxiv.2509.14746,
  title  = {Chain-of-Thought Re-ranking for Image Retrieval Tasks},
  author = {Shangrong Wu and Yanghong Zhou and Yang Chen and Feng Zhang and P. Y. Mok},
  journal= {arXiv preprint arXiv:2509.14746},
  year   = {2025}
}