基于预测提示和负面学习的通用视觉语言少样本适应
计算机视觉与模式识别
2026-05-26 v2 人工智能
图形学
机器人学
摘要
视觉语言模型的少样本适应在负类信号处理方式上存在根本性局限。现有方法在所有查询上施加统一的负面抑制,忽略了最具破坏性的混淆是查询特定的,并且随 support-set 几何形状而变化。我们引入 SCAN (Selective Confusion-Aware Negatives),一个框架通过三个有针对性的贡献来解决这一问题。在推理阶段,查询自适应负面路由将抑制限制于每个查询最具混淆性的 top-K 类,无需额外参数。用 LLM 生成的对抗性提示取代通用负面文本模板,这些提示描述了混淆类别对之间的判别属性,在最需要的地方锐化文本决策边界。基于 support-set Fisher 判别性估计的参数自由自适应融合权重,消除了对视觉语言权衡进行手动调参的需求。在 11 个标准基准测试中评估的 SCAN consistently 优于先前基于提示和适配器的方法,16-shot 下平均提升 4.61%,在类别间混淆最严重的细粒度数据集上提升最高可达 7.70%。SCAN 也在分布迁移下表现出强大的泛化能力,在四个 ImageNet OOD 变体中平均提升 2.95%,在显著标签噪声下仍保持稳健性能,当标签损坏达到 50% 时,准确率仍超过最强竞争方法的干净基线。
引用
@article{arxiv.2505.11758,
title = {Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning},
author = {Sriram Mandalika},
journal= {arXiv preprint arXiv:2505.11758},
year = {2026}
}