中文

基于双提示调优的主动 CLIP 适应显式不确定性建模

计算机视觉与模式识别 2026-02-05 v1 人工智能

摘要

预训练视觉语言模型如 CLIP 具备强大的可迁移性,但在标注预算有限的情况下将其适应下游图像分类任务仍具挑战。在主动学习场景中,模型必须从大规模无标签数据中选择最具信息性的样本进行标注。现有方法通常通过熵基准或表示聚类估计不确定性,却未从模型视角显式建模不确定性。本文提出一种基于双提示调优的主动 CLIP 适应鲁棒不确定性建模框架。我们在 CLIP 的文本分支引入两个可学习的提示。正提示增强任务特定文本嵌入对应轻量级调优视觉嵌入的判别性,提高分类可靠性。而负提示则以相反方式训练,以显式建模预测标签正确的概率,为引导主动样本选择提供原则性的不确定性信号。大量实验表明,在相同标注预算下,我们的方法 consistently 优于现有主动学习方法。

关键词

引用

@article{arxiv.2602.04340,
  title  = {Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning},
  author = {Qian-Wei Wang and Yaguang Song and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2602.04340},
  year   = {2026}
}