中文

基于互补视觉-语义集成的细粒度零样本组合图像检索

计算机视觉与模式识别 2026-01-21 v1

摘要

零样本组合图像检索(ZS-CIR)是一个快速发展的领域,具有重要的实际应用,允许用户通过提供参考图像和描述所需修改的相对标题来检索目标图像。现有的ZS-CIR方法通常难以捕捉细粒度变化并有效整合视觉和语义信息。它们主要依赖于使用图像到文本模型将多模态查询转换为单一文本,或使用大型语言模型生成目标图像描述,这些方法往往无法捕捉互补的视觉信息和完整的语义上下文。为了解决这些局限性,我们提出了一种新颖的基于互补视觉-语义集成(CVSI)的细粒度零样本组合图像检索方法。具体而言,CVSI利用三个关键组件:(1)视觉信息提取,不仅提取全局图像特征,还使用预训练的映射网络将图像转换为伪令牌,并将其与修改文本和最可能添加的对象相结合。(2)语义信息提取,涉及使用预训练的字幕生成模型为参考图像生成多个字幕,然后利用大语言模型(LLM)生成修改后的字幕和最可能添加的对象。(3)互补信息检索,整合从查询图像和数据库图像中提取的信息以检索目标图像,使系统能够高效处理各种情况下的检索查询。在三个公开数据集(例如CIRR、CIRCO和FashionIQ)上的大量实验表明,CVSI显著优于现有的最先进方法。我们的代码可在https://github.com/yyc6631/CVSI获取。

关键词

引用

@article{arxiv.2601.14060,
  title  = {Fine-Grained Zero-Shot Composed Image Retrieval with Complementary Visual-Semantic Integration},
  author = {Yongcong Ye and Kai Zhang and Yanghai Zhang and Enhong Chen and Longfei Li and Jun Zhou},
  journal= {arXiv preprint arXiv:2601.14060},
  year   = {2026}
}