中文

面向视觉语言模型的高效通用少样本误分类检测方法

计算机视觉与模式识别 2025-03-27 v1 人工智能

摘要

可靠的分类器预测对于其在高安全性和动态变化场景中的部署至关重要。然而,现代神经网络往往对误分类的预测表现出过度自信,这凸显了对置信度估计进行误分类检测的需求。尽管现有方法在小规模数据集上取得了显著成果,但它们都需要从头训练,且缺乏高效且有效的误分类检测 (MisD) 方法,限制了在大规模和不断变化的数据集上的实际应用。本文 paving the way (铺垫) 利用视觉语言模型 (VLM) 利用文本信息构建高效且通用的误分类检测框架。通过运用 VLM,我们构建了 FSMisD,即一种用于 MisD 的少样本提示学习框架,以避免从头训练,从而提升调优效率。为增强误分类检测能力,我们采用自适应伪样本生成技术和一种新型负损失,以通过将类别提示远离伪特征来缓解过度自信问题。我们采用提示学习方法进行了全面实验,并在各种数据集上验证了其在域迁移情况下的泛化能力。显著且持续的改进表明了该方法在有效性、效率和通用性方面的卓越表现。

关键词

引用

@article{arxiv.2503.20492,
  title  = {Towards Efficient and General-Purpose Few-Shot Misclassification Detection for Vision-Language Models},
  author = {Fanhu Zeng and Zhen Cheng and Fei Zhu and Xu-Yao Zhang},
  journal= {arXiv preprint arXiv:2503.20492},
  year   = {2025}
}

备注

preprint