中文

通过解耦视觉提示理解 CLIP 的模型重编程

机器学习 2025-06-03 v1 计算机视觉与模式识别

摘要

模型重编程通过仅修改输入和输出空间,将预训练模型适配到下游任务。视觉重编程(VR)是视觉任务的一个实例,它向输入图像添加可训练的噪声模式(即视觉提示)以促进下游分类。现有的针对 CLIP 的 VR 方法使用不同下游类别的所有描述来训练单一视觉提示。然而,有限的学习能力可能导致:(1)无法捕捉描述的多样方面(如形状、颜色和纹理),以及(2)可能偏向于无助于区分类别的信息量较少的属性。在本文中,我们引入了解耦与重加权框架。我们的解耦视觉提示(DVP)使用按显式原因分组的描述(DVP-cse)或无监督聚类(DVP-cls)进行优化。然后,我们通过概率重加权矩阵(PRM)整合这些视觉提示的输出,该矩阵衡量它们对每个下游类别的贡献。在理论上,DVP 降低了经验风险界。在实验上,DVP 在 11 个下游数据集上平均优于基线。值得注意的是,DVP-PRM 的整合使人们能够深入了解单个视觉提示如何影响分类决策,为理解重编程提供了概率框架。我们的代码可在 https://github.com/tmlr-group/DecoupledVP 获取。

关键词

引用

@article{arxiv.2506.01000,
  title  = {Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts},
  author = {Chengyi Cai and Zesheng Ye and Lei Feng and Jianzhong Qi and Feng Liu},
  journal= {arXiv preprint arXiv:2506.01000},
  year   = {2025}
}