中文

STiTch:语义过渡与协作在无训练零样本组合图像检索中的应用

计算机视觉与模式识别 2026-05-21 v1

摘要

训练免费的零样本组合图像检索模型最近因其在不可见多模态检索中的通用性和灵活性而受到日益关注的研究兴趣。最近的基于大语言模型的方法聚焦于通过探索大语言模型背后的组合能力来生成预期的目标标题。虽然高效,但我们发现存在两个问题:一是生成的标题倾向于引入参考图像中意外的特征,由于输入图像与文本修改之间的语义差距,图像包含的细节远多于文本;二是检索阶段的点到点对齐未能捕捉多样化的组合。为此,我们提出了一种用于训练免费零样本组合图像检索任务的 novel 语义过渡与在协作框架中进行交通。具体而言,给定由大语言模型推断的组合标题,我们通过嵌入空间中的过渡向量对其进行细化,并使其更接近目标图像。结合大语言模型与用户指令,该细化后的标题更集中于核心修改意图,从而过滤掉不必要的噪声。此外,为探索检索阶段的多样化对齐,我们将图像和标题建模为离散分布,并将检索任务重新表述为集合到集合对齐任务。最后,开发了双向交通距离,以考虑跨模态的细粒度对齐并计算检索得分。大量实验表明,我们的方法在许多组合图像检索任务中表现出良好的通用性、有效性和益处。

关键词

引用

@article{arxiv.2605.21261,
  title  = {STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval},
  author = {Miaoge Li and Dongsheng Wang and Zening Sun and Jinsen Zhang and Wenhan Luo and Jingcai Guo},
  journal= {arXiv preprint arXiv:2605.21261},
  year   = {2026}
}