中文

Caption-Matching:一种用于跨域图像检索的多模态方法

计算机视觉与模式识别 2026-04-09 v3

摘要

跨域图像检索(CDIR)是计算机视觉中一项具有挑战性的任务,旨在匹配不同视觉域(如草图、绘画和照片)的图像。现有的CDIR方法要么依赖于带有标注跨域对应关系的监督学习,要么依赖于需要在目标数据集上进行训练或微调的方法,这些方法通常难以应对显著的域差异,且对未见域的泛化能力有限。本文引入了一种新颖的CDIR方法,通过利用公开可用的预训练视觉-语言模型来整合文本上下文。我们的方法名为Caption-Matching(CM),使用生成的图像描述作为与域无关的中间表示,从而无需标注数据或进一步训练即可实现有效的跨域相似度计算。我们在标准的CDIR基准数据集上评估了我们的方法,在即插即用的设置下展示了最先进的性能,在Office-Home和DomainNet数据集上相较于先前方法取得了持续改进。我们还在一个来自Midjourney的AI生成图像数据集上展示了我们方法的有效性,证明了其处理复杂的多域查询的能力。

关键词

引用

@article{arxiv.2403.15152,
  title  = {Caption-Matching: A Multimodal Approach for Cross-Domain Image Retrieval},
  author = {Lucas Iijima and Nikolaos Giakoumoglou and Tania Stathaki},
  journal= {arXiv preprint arXiv:2403.15152},
  year   = {2026}
}