中文

利用大型语言模型和视觉语言模型实现鲁棒的零样过分布检测

计算机视觉与模式识别 2025-01-10 v1

摘要

过分布(OOD)检测通过利用强大的视觉语言模型(VLM)如 CLIP 实现的零样方法取得了显著进展。然而,先前研究主要聚焦于提高远域 OOD(Far-OOD)性能,而可能以牺牲近域 OOD(Near-OOD)有效性为代价,正如我们 pilot 研究所见。为此,我们提出了一种新颖策略,通过创造性地利用大型语言模型(LLM)和 VLM 来提升零样 OOD 检测在 Far-OOD 和 Near-OOD 场景中的性能。我们的 approach 首先利用 LLM 生成 ID 标签的超类及其对应的背景描述,随后使用 CLIP 进行特征提取。我们通过从背景特征中减去超类特征来隔离 ID 数据的核心语义特征。精炼后的表征有助于从 WordNet 的全面候选标签集合中选择更合适的 OOD 数据负标签,从而提升零样 OOD 检测在两种场景中的性能。此外,我们引入了新的少样本提示调优和视觉提示调优,以更好地适应目标分布。实验结果表明,我们的方法在多个基准上 consistently 超过当前最先进的方法,在 AUROC 上提升最高可达 2.9%,在 FPR95 上降低最高可达 12.6%。此外,我们的方法在不同领域之间展现出对协变量位移的优异鲁棒性,进一步凸显了其在实际场景中的有效性。

关键词

引用

@article{arxiv.2501.05228,
  title  = {Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection},
  author = {Pei-Kang Lee and Jun-Cheng Chen and Ja-Ling Wu},
  journal= {arXiv preprint arXiv:2501.05228},
  year   = {2025}
}

备注

9 pages, 4 figures