基于双提示调优的主动 CLIP 适应显式不确定性建模
计算机视觉与模式识别
2026-02-05 v1 人工智能
摘要
预训练视觉语言模型如 CLIP 具备强大的可迁移性,但在标注预算有限的情况下将其适应下游图像分类任务仍具挑战。在主动学习场景中,模型必须从大规模无标签数据中选择最具信息性的样本进行标注。现有方法通常通过熵基准或表示聚类估计不确定性,却未从模型视角显式建模不确定性。本文提出一种基于双提示调优的主动 CLIP 适应鲁棒不确定性建模框架。我们在 CLIP 的文本分支引入两个可学习的提示。正提示增强任务特定文本嵌入对应轻量级调优视觉嵌入的判别性,提高分类可靠性。而负提示则以相反方式训练,以显式建模预测标签正确的概率,为引导主动样本选择提供原则性的不确定性信号。大量实验表明,在相同标注预算下,我们的方法 consistently 优于现有主动学习方法。
引用
@article{arxiv.2602.04340,
title = {Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning},
author = {Qian-Wei Wang and Yaguang Song and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2602.04340},
year = {2026}
}