中文

面向带标签噪声的视觉语言模型的内在梯度抑制

计算机视觉与模式识别 2026-05-04 v1

摘要

类似 CLIP 的对比式视觉语言模型表现出显著的零样本泛化能力。然而,prompt tuning 对标签噪声极其敏感,因误标记样本会产生远超预训练先验的梯度。我们认为,由于 CLIP 已提供近乎最优的初始化,适应过程应本质上保持保守,尤其是在噪声环境下常见的极端梯度更新。为此,我们提出双软最大化方案 (Double-Softmax Prompt Tuning, DSPT),一种用于内在梯度抑制的无需调参的方法。通过应用顺序概率归一化,DSPT 诱导自适应饱和区,以抑制高误差噪声样本的梯度,同时保持信息化更新。我们提供了理论分析与实证证据,说明此机制实现了自适应抑制。该设计将“梯度消失”——传统训练瓶颈——转化为标签噪声 prompt tuning 的原则性噪声滤波护盾。广泛实验表明,这一简单且即插即用的设计在各种噪声基准上实现了最先进的鲁棒性,超越了复杂架构与手工调参方法。

关键词

引用

@article{arxiv.2605.00591,
  title  = {Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models},
  author = {Jiayu Li and Jiaxin Qi and Sheng Zhou and Jiaqiang Huang and Xiansheng Hua},
  journal= {arXiv preprint arXiv:2605.00591},
  year   = {2026}
}