中文

OSLoPrompt:弥合 CLIP 中低监督挑战与开集域泛化

计算机视觉与模式识别 2025-03-21 v1

摘要

我们引入了低样本开集域泛化(LSOSDG),这是一种将低样本学习与开集域泛化(ODG)相统一的新范式。尽管使用 CLIP 等模型的基于提示的方法推进了域泛化(DG),但它们在低数据场景(例如 1-shot)中表现不佳,并且在检测与训练类具有细粒度语义相关的开集样本时缺乏精度。为了应对这些挑战,我们提出了 OSLOPROMPT,这是一个用于 CLIP 的高级提示学习框架,具有两项核心创新。首先,为了管理源域之间有限的监督并改进 DG,我们引入了一种与域无关的提示学习机制,该机制通过新颖的交叉注意力模块集成了可适应的特定域线索和视觉引导的语义属性,此外还得到可学习的域通用和类通用视觉提示的支持,以增强跨模态适应性。其次,为了改进推理过程中的异常值拒绝,我们将不熟悉的样本分类为“未知”,并使用系统合成的伪开集样本训练专门的提示,这些样本保持了与已知类的细粒度关系,是通过使用现成基础模型的针对性查询策略生成的。该策略增强了特征学习,使我们的模型能够更有效地检测具有不同粒度的开集样本。在五个基准上的广泛评估表明,OSLOPROMPT 在 LSOSDG 中确立了新的 SOTA,显著优于现有方法。

关键词

引用

@article{arxiv.2503.16106,
  title  = {OSLoPrompt: Bridging Low-Supervision Challenges and Open-Set Domain Generalization in CLIP},
  author = {Mohamad Hassan N C and Divyam Gupta and Mainak Singha and Sai Bhargav Rongali and Ankit Jha and Muhammad Haris Khan and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2503.16106},
  year   = {2025}
}

备注

Accepted to CVPR 2025