中文

基于VLM的OOD检测实证分析:机制、优势与灵敏性

计算机视觉与模式识别 2025-09-18 v1 人工智能

摘要

视觉语言模型(Vision-Language Models,VLMs,如CLIP)在零样态异常分布检测(Out-of-Distribution,OOD)方面展现出惊人的能力,这对于可靠的AI系统至关重要。尽管具备良好能力,但关于(1)其为何如此有效,(2)其相较于单模态方法的优势,(3)其行为鲁棒性——仍在研究社区中明显不完整。本文对VLM-based OOD检测进行系统实证分析,运用in分布(ID)与OOD提示。(1)机制:我们系统化刻画并形式化VLM嵌入空间中的关键操作属性,以促进零样态OOD检测。(2)优势:我们经验性地量化了这些模型相较于 established 单模态方法的优越性,归因于VLM利用丰富语义新颖性的能力。(3)灵敏性:我们发现其鲁棒性轮廓中存在显著且此前较少探讨的非对称性:这些VLM-based方法对常见图像噪声表现出韧性,但对提示措辞极其敏感。我们的发现为更结构化地理解VLM-based OOD检测的优势与关键脆弱性提供了依据,为开发更可靠、更可靠的未来设计提供了至关重要的实证依据。

关键词

引用

@article{arxiv.2509.13375,
  title  = {An Empirical Analysis of VLM-based OOD Detection: Mechanisms, Advantages, and Sensitivity},
  author = {Yuxiao Lee and Xiaofeng Cao and Wei Ye and Jiangchao Yao and Jingkuan Song and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2509.13375},
  year   = {2025}
}