GOPro:基于自监督学习在 CLIP 中生成与优化提示
计算机视觉与模式识别
2023-08-23 v1
摘要
大规模基础模型(如 CLIP)通过将图像嵌入语义丰富空间,在视觉识别任务中取得显著成功。自监督学习(SSL)亦通过学习不变特征在提升视觉识别方面展现潜力。然而,CLIP 与 SSL 的结合面临挑战,因其多任务框架混合了 CLIP 的对比损失与 SSL 的损失,包括损失加权困难以及 CLIP 输出空间中图像不同视图间的不一致。为克服这些挑战,我们提出一种基于提示学习的模型 GOPro,其是一个统一框架,利用 CLIP 之上的可学习图像与文本投影器对,在共享的图像-文本嵌入空间中确保输入图像各种增强视图间的相似性,以提升不变性与泛化能力。为自动学习此类提示,我们利用从预训练 CLIP 中提取的视觉内容与风格基元,并将其适配至目标任务。除 CLIP 的跨域对比损失外,我们引入视觉对比损失与一种新颖的提示一致性损失,以考量图像的不同视图。GOPro 以端到端方式在全部三个损失目标上训练,以原则性方式结合 CLIP 与 SSL 的优势。实证评估表明,GOPro 在多个基准的三个具有挑战性的域泛化任务上,以显著优势超越最先进的提示技术。我们的代码见 https://github.com/mainaksingha01/GOPro。
引用
@article{arxiv.2308.11605,
title = {GOPro: Generate and Optimize Prompts in CLIP using Self-Supervised Learning},
author = {Mainak Singha and Ankit Jha and Biplab Banerjee},
journal= {arXiv preprint arXiv:2308.11605},
year = {2023}
}
备注
Accepted at BMVC 2023