中文

基于CLIP类模型的分布外检测最新进展:综述

计算机视觉与模式识别 2025-05-06 v1

摘要

分布外检测(OOD)是实际应用中的关键任务,旨在训练模型在测试时识别与分布内(ID)数据在分布上不同的样本。人工智能的最新进展,特别是CLIP等视觉语言模型(VLM),通过从传统的单模态图像检测器转向多模态图像-文本检测器,彻底革新了OOD检测。这一转变激发了大量研究;然而,现有的分类方案(如少样本或零样本类型)仍然仅依赖于分布内图像的可用性,遵循单模态范式。为更好地契合CLIP的跨模态特性,我们提出了一种新的分类框架,该框架根植于图像和文本两种模态。具体而言,我们根据OOD数据中的视觉和文本信息在图像+文本模态中的利用方式对现有方法进行分类,并进一步将其分为四组:分布外图像(即离群点)已见或未见,以及分布外文本(即可学习向量或类别名称)已知或未知,涵盖两种训练策略(即无需训练或需要训练)。更重要的是,我们讨论了CLIP类OOD检测中的开放问题,并指出了未来研究的有前景方向,包括跨领域整合、实际应用和理论理解。

关键词

引用

@article{arxiv.2505.02448,
  title  = {Recent Advances in Out-of-Distribution Detection with CLIP-Like Models: A Survey},
  author = {Chaohua Li and Enhao Zhang and Chuanxing Geng and Songcan Chen},
  journal= {arXiv preprint arXiv:2505.02448},
  year   = {2025}
}