敢于选择负文本:基于视觉语言模型的 OOD 检测中的距离一致性
计算机视觉与模式识别
2026-04-21 v3
摘要
OOD 检测旨在识别来自未知类别的样本,这是将机器学习模型部署到开放式场景中的关键能力。最近的研究表明,视觉语言模型(Vision-Language Models, VLMs)能够有效利用其多模态表示进行 OOD 检测。然而,当前方法常在 OOD 检测中包含单模态距离,例如将负文本与 ID 标签进行比较或将测试图像与图像代理进行比较。这种设计范式在本质上与 CLIP 等 VLMs 优化的跨模态距离不一致,可能导致次优性能。为解决这一局限,我们提出了 InterNeg,一个简单而有效的框架,系统性地利用来自文本和视觉视角的一致跨模态距离增强。从文本视角,我们设计了选择负文本的跨模态准则。从视觉视角,我们动态识别高置信度的 OOD 图像并将其逆变换到文本空间,生成额外的负文本嵌入,由跨模态距离引导。广泛的实验表明,我们方法的优越性。值得注意的是,我们的 InterNeg 在大规模 ImageNet 基准测试上以 3.47% 的 FPR95 降低实现了最先进的性能;在具有挑战性的 Near-OOD 基准测试上,AUROC 提升了 5.50%。
引用
@article{arxiv.2603.02618,
title = {Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs},
author = {Zhikang Xu and Qianqian Xu and Zitai Wang and Cong Hua and Sicong Li and Zhiyong Yang and Qingming Huang},
journal= {arXiv preprint arXiv:2603.02618},
year = {2026}
}
备注
Accepted by the main track of CVPR 2026