中文

NLPrompt:基于噪声标签的视觉语言模型提示学习

计算机视觉与模式识别 2026-01-29 v3 机器学习

摘要

视觉语言基础模型(如 CLIP)的出现 revolutionized了图像-文本表示,使其通过提示学习实现广泛应用。尽管前景广阔,但实际数据集常包含噪声标签,会降低提示学习性能。本文证明,使用称为 PromptMAE 的 MAE 损失进行提示学习,可显著提升对噪声标签的鲁棒性,同时保持高准确率。虽然 MAE 简单且因其鲁棒性而被广泛认可,但因收敛缓慢且在提示学习场景之外表现不佳,通常不用于噪声标签学习。为阐明 PromptMAE 的鲁棒性,我们利用特征学习理论表明,MAE 可抑制噪声样本的影响,从而提升信噪比并增强整体鲁棒性。此外,我们引入PromptOT,即基于提示的 optimal transport 数据净化方法,以进一步提升鲁棒性。PromptOT 利用视觉语言模型中的文本特征作为原型构建 optimal transport 矩阵。该矩阵有效地将数据集划分为干净子集和噪声子集,允许对干净子集应用交叉熵损失,对噪声子集应用 MAE 损失。我们提出的名为 NLPrompt 的 Noise-Label Prompt Learning 方法,提供了一个简单且高效的方案,利用视觉语言模型的表征表达能力和精确对齐能力进行稳健的提示学习。我们通过各种噪声设置下的广泛实验验证了 NLPrompt,显示出显著的性能提升。

关键词

引用

@article{arxiv.2412.01256,
  title  = {NLPrompt: Noise-Label Prompt Learning for Vision-Language Models},
  author = {Bikang Pan and Qun Li and Xiaoying Tang and Wei Huang and Zhen Fang and Feng Liu and Jingya Wang and Jingyi Yu and Ye Shi},
  journal= {arXiv preprint arXiv:2412.01256},
  year   = {2026}
}