中文

UCDR-Adapter: 探索预训练视觉-语言模型在通用跨域检索中的适配

计算机视觉与模式识别 2024-12-17 v1 信息检索 多媒体

摘要

通用跨域检索 (Universal Cross-Domain Retrieval, UCDR) 在无语义标签的情况下从未见过的域和类别中检索相关图像,以确保稳健的泛化能力。现有方法通常在预训练视觉-语言模型上采用提示微调,但本质上受限于静态提示,降低了适应性。我们提出了 UCDR-Adapter,通过适配器和动态提示生成,采用两阶段训练策略来增强预训练模型。首先,源适配器学习利用可学习文本语义模板将类别语义与特定域的视觉知识相结合,并通过动量更新和双重损失函数优化类别和域提示,以实现稳健的对齐。其次,目标提示生成通过对掩码源提示进行注意力操作来创建动态提示,从而实现对未见域和类别的无缝适配。与以往方法不同,UCDR-Adapter 能够动态适应不断变化的数据分布,增强了灵活性和泛化能力。在推理阶段,仅使用图像分支和生成的提示,消除了对文本输入的依赖,实现了高效检索。大量的基准实验表明,UCDR-Adapter 在大多数情况下均优于 ProS,并在 UCDR、U(c)CDR 和 U(d)CDR 设置下优于其他最先进方法。

关键词

引用

@article{arxiv.2412.10680,
  title  = {UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval},
  author = {Haoyu Jiang and Zhi-Qi Cheng and Gabriel Moreira and Jiawen Zhu and Jingdong Sun and Bukun Ren and Jun-Yan He and Qi Dai and Xian-Sheng Hua},
  journal= {arXiv preprint arXiv:2412.10680},
  year   = {2024}
}

备注

Accepted to WACV 2025. Project link: https://github.com/fine68/UCDR2024