FA:视觉语言模型的强制提示学习用于分布外检测
计算机视觉与模式识别
2025-09-30 v3
摘要
预训练的视觉语言模型(VLM)最近推动了分布外(OOD)检测的发展。然而,现有的基于CLIP的方法通常侧重于学习与OOD相关的知识以提高OOD检测性能,表现出有限的泛化性或依赖于外部大规模辅助数据集。在本研究中,我们不再深入研究复杂的OOD相关知识,而是提出了一种基于强制提示学习(FA)的创新性CLIP框架,旨在充分利用分布内(ID)知识,最终提升OOD检测的效果。我们的关键见解是学习一个提示(即强制提示),该提示包含比类别标签的文本语义更多样化和更丰富的ID类别描述。具体来说,它通过强制ID图像与可学习的强制提示之间产生更显著的语义相似性,从而促进对ID图像更好的辨别。此外,我们引入了一个强制系数,鼓励强制提示学习更全面和细致的ID类别描述。通过这种方式,FA能够在无需任何外部辅助数据集训练的情况下实现OOD检测的显著改进,同时保持与CoOp相同的可训练参数数量。大量的实证评估证实了我们的方法持续优于当前最先进的方法。代码可在https://github.com/0xFAFA/FA获取。
引用
@article{arxiv.2507.04511,
title = {FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution Detection},
author = {Xinhua Lu and Runhe Lai and Yanqi Wu and Kanghao Chen and Wei-Shi Zheng and Ruixuan Wang},
journal= {arXiv preprint arXiv:2507.04511},
year = {2025}
}
备注
12 pages, 4 figures, Accepted by ICCV2025