使用大语言模型进行正负提示监督的类分布外检测
计算机视觉与模式识别
2025-11-17 v1
摘要
类分布外(OOD)检测旨在描绘类别分布内(ID)与类分布外图像之间的分类边界。近期视觉语言模型(VLM)的进展表明,通过整合视觉与文本两种模态,能够实现卓越的 OOD 检测性能。在此背景下,引入负提示以强调图像特征与提示内容之间的不相似性。然而,这些提示常包含广泛的非 ID 特征,可能因捕获重叠或误导性信息而导致次优结果。为此,本文提出正负提示监督方法,鼓励负提示捕获类别间特征,并将这种语义知识传递到视觉模态,从而提升 OOD 检测性能。本方法首先由大语言模型(LLM)初始化类别特定的正负提示。随后对这些提示进行优化,其中正提示聚焦于每个类别内部的特征,而负提示则突出类别边界附近的特征。此外,采用基于图的架构来聚合经优化提示表示所提供的语义感知监督,并将其传递到视觉分支,从而提升基于能量的 OOD 检测器性能。在 CIFAR-100 和 ImageNet-1K 两个基准数据集上,分别测试了八个 OOD 数据集和五个不同 LLM,实验结果表明,我们的方法在 OOD 检测任务上优于最新方法。
引用
@article{arxiv.2511.10923,
title = {Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language Models},
author = {Zhixia He and Chen Zhao and Minglai Shao and Xintao Wu and Xujiang Zhao and Dong Li and Qin Tian and Linlin Yu},
journal= {arXiv preprint arXiv:2511.10923},
year = {2025}
}