通过多模态提示学习全面提升零样本基于草图的图像检索
计算机视觉与模式识别
2024-07-24 v2
摘要
我们利用视觉-语言基础模型 CLIP,解决了各种设置下基于草图的图像检索 (SBIR) 固有的挑战,包括零样本 SBIR、广义零样本 SBIR 和细粒度零样本 SBIR。虽然近期的努力采用了 CLIP 来增强 SBIR,但这些方法主要遵循单模态提示处理,忽略了充分利用 CLIP 集成的视觉和文本能力。为了弥合这一差距,我们引入了 SpLIP,这是一种新颖的多模态提示学习方案,旨在有效地与冻结的 CLIP 主干网络配合工作。我们偏离了现有的多模态提示方法,这些方法独立地处理视觉和文本提示或以有限的方式整合它们,导致次优的泛化能力。SpLIP 实施了双向提示共享策略,实现了 CLIP 视觉和文本编码器之间的相互知识交流,促进了更具凝聚力和协同性的提示处理机制,从而显著缩小了草图与照片嵌入之间的语义鸿沟。除了开创多模态提示学习外,我们还提出了两种创新策略以进一步精炼嵌入空间。第一种是针对草图-照片三元组损失的自适应间隔生成,由 CLIP 的类别文本嵌入调节。第二种引入了一项名为条件跨模态拼图的新颖任务,旨在通过利用未打乱照片的知识隐式建模草图的可行图块排列,以增强细粒度的草图-照片对齐。我们在多个基准上的全面实验评估证明了 SpLIP 在所有三种 SBIR 场景中的卓越性能。项目页面:https://mainaksingha01.github.io/SpLIP/ 。
引用
@article{arxiv.2407.04207,
title = {Elevating All Zero-Shot Sketch-Based Image Retrieval Through Multimodal Prompt Learning},
author = {Mainak Singha and Ankit Jha and Divyam Gupta and Pranav Singla and Biplab Banerjee},
journal= {arXiv preprint arXiv:2407.04207},
year = {2024}
}
备注
Accepted in ECCV 2024