中文

面向视觉-语言模型的中性参考提示方法

计算机视觉与模式识别 2026-05-18 v1 机器学习

摘要

视觉-语言模型(VLM)的高效迁移学习通常面临基类-新类权衡(BNT):提升对未见(新)类别的性能往往会降低对已知(基类)类别的准确率。如何在不牺牲已知类别性能的前提下提升对未见类别的识别能力,仍然是一个核心挑战。现有工作通常简单地将基类-新类权衡归因于对已知类别的过拟合。我们观察到一个有趣的现象:视觉-语言模型在某些下游数据上频繁表现出不对称混淆,即 A 类样本被系统性地误预测为 B 类,而反向混淆(B 类到 A 类)很少发生。对于已知类别,这种偏差可以通过使用交叉熵损失进行微调来缓解,但对于未见类别,这种预训练诱导的偏差会持续存在并损害泛化能力。受此启发,我们提出了 NeRP,一种即插即用的提示校正策略,它能在不修改模型参数的情况下提升对未见类别的判别能力。NeRP 利用中性文本提示和参考图像,沿预训练的类间几何结构测量类别先验偏好,并将其与样本似然相结合以获得模型的替代分数。如果对于给定样本,先验强烈支持当前预测,而观察到的证据明显不足,我们会在容易混淆的类别对之间执行局部翻转,从而纠正由先验主导的错误预测。在多个骨干网络和 15 个小样本及跨域基准上的大量实验表明,NeRP 在保持已知类别预测性能的同时,显著提高了未见类别的准确率。

关键词

引用

@article{arxiv.2605.15615,
  title  = {Neutral-Reference Prompting for Vision-Language Models},
  author = {Senmao Tian and Xiang Wei and Shunli Zhang},
  journal= {arXiv preprint arXiv:2605.15615},
  year   = {2026}
}

备注

Accepted at ICML 2026