未知提示,唯一的空白:揭示CLIP在开放域泛化中的潜力
计算机视觉与模式识别
2024-04-02 v1
摘要
我们深入探讨开放域泛化(ODG),其特征在于训练时的有标签源域与测试时的无标签目标域之间存在域偏移和类别偏移。由于传统CNN骨干网络受限的泛化能力以及在缺乏先验知识时检测目标开放样本的误差,现有的ODG解决方案面临局限性。针对这些缺陷,我们引入了 ODG-CLIP,利用视觉-语言模型 CLIP 的语义能力。我们的框架带来了三项主要创新:首先,与现有范式不同,我们将 ODG 概念化为一个包含已知类和新类的多类分类挑战。我们方法的核心是建模一个专为检测未知类样本而定制的独特提示,为了训练它,我们采用易于获取的稳定扩散模型,优雅地为开放类生成代理图像。其次,旨在获得针对特定域的分类(提示)权重,同时兼顾精度与简洁性的平衡,我们设计了一种新颖的以视觉风格为中心的提示学习机制。最后,我们将源自提示空间的类别判别知识注入图像中,以增强 CLIP 视觉嵌入的保真度。我们引入了一个新颖的目标函数,以保障这种注入的语义信息跨域的连续性,特别是对于共享类。通过在涵盖闭集和开集域泛化情境的多样化数据集上进行严格测试,ODG-CLIP 展现了明显的优越性,以 8%-16% 的性能提升持续超越同类方法。代码将在 https://github.com/mainaksingha01/ODG-CLIP 提供。
引用
@article{arxiv.2404.00710,
title = {Unknown Prompt, the only Lacuna: Unveiling CLIP's Potential for Open Domain Generalization},
author = {Mainak Singha and Ankit Jha and Shirsha Bose and Ashwin Nair and Moloud Abdar and Biplab Banerjee},
journal= {arXiv preprint arXiv:2404.00710},
year = {2024}
}
备注
Accepted in CVPR 2024