中文

极端域偏移下少样本适应的多重随机提示调参

计算机视觉与模式识别 2025-08-13 v2

摘要

基础视觉语言模型(VLM)如CLIP由于在大规模多样化图像-文本对上预训练而展现出强大的泛化能力。然而,当应用于在视觉外观和类别语义上均存在显著分布偏移的目标数据集时,其性能经常下降。近期的少样本学习方法通过适配器或提示调参利用有限的标注数据将CLIP适配至下游任务,但并非专门设计用于处理此类极端域偏移。相反,一些处理跨域少样本学习的工作考虑了此类域偏移场景,但仅在每个episode中处理少量类别,限制了其在真实世界部署中的适用性,因为在真实部署中必须同时处理所有类别。为弥补这一空白,我们提出了一种新颖框架MIST(多重随机提示调参),用于仅使用少量标注示例高效地将CLIP适配至具有极端分布偏移的数据集,在一次性处理所有类别的场景中。具体而言,我们为每个类别引入多个可学习提示,以有效捕捉由分布偏移引起的视觉表征中的多种模式。为进一步增强泛化能力,这些提示被建模为可学习的高斯分布,实现了对提示参数空间的高效探索,并减少了因有限监督导致的过拟合。大量实验和与最先进方法的比较证明了所提出框架的有效性。

关键词

引用

@article{arxiv.2506.03926,
  title  = {Multiple Stochastic Prompt Tuning for Few-shot Adaptation under Extreme Domain Shift},
  author = {Debarshi Brahma and Soma Biswas},
  journal= {arXiv preprint arXiv:2506.03926},
  year   = {2025}
}