中文

面向强语义噪声的鲁棒视觉语言模型提示调优

计算机视觉与模式识别 2025-10-03 v3

摘要

提示调优已显示出前景,但其对未知类别的鲁棒性和泛化能力仍受限。通过实验,我们证明消除提示中语义噪声的完整性是限制鲁棒性的关键因素。现有方法通常抑制或过滤提示中的语义噪声,潜在地削弱了模型的鲁棒性及其对未知类别的泛化能力。为此,我们提出了ANPrompt——一个主动纳入弱语义噪声的鲁棒提示调优框架。通过聚类弱扰动特征至噪声提示,并将其与文本和视觉编码器中的可学习标记集成,ANPrompt确保了对语义变化的受控暴露。为增强视觉路径,我们引入了噪声抗性视觉提示原型(Noise-Resistant Visual Prompt Prototype,NRVPP),在弱扰动下稳定视觉语义。此外,我们提出了在逻辑层面上的弱对齐损失(Weak Alignment Loss,WALoss),以在干净和扰动预测之间实现一致性,提供稳定的监督信号。通过将弱语义噪声暴露与逻辑级一致性相结合,ANPrompt可防止对特定表述方式的过拟合,同时保持语义完整性。在包括基座到新类别划分在内的11个基准测试中进行了广泛实验,结果表明ANPrompt consistently优于现有提示调优方法,在语义噪声鲁棒性和跨任务泛化方面表现优异。

关键词

引用

@article{arxiv.2508.04677,
  title  = {Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise},
  author = {Yansheng Gao and Yufei Zheng and Shengsheng Wang},
  journal= {arXiv preprint arXiv:2508.04677},
  year   = {2025}
}