中文

SimLabel:基于预训练视觉语言模型的一致性引导的无分布检测

计算机视觉与模式识别 2025-01-22 v1

摘要

检测无分布(OD)数据在实际机器学习应用中至关重要,特别是在安全关键领域。现有方法常利用视觉语言模型(VLM)中的语言信息来增强OD检测,通过改进置信度估计来提高对丰富类别文本信息的利用。然而,当构建基于无分布文本-图像亲和力的OD检测得分时,现有工作要么关注每个无分布类别,要么关注整个无分布标签集合,忽略了无分布类别之间内在联系。我们发现,来自不同无分布类别的语义信息对有效OD检测有益。因此,我们研究了VLMs中不同语义相关无分布标签之间的图像-文本理解能力,并提出了一种名为SimLabel的新型后处理策略。SimLabel通过建立一种考虑一组相似类别标签一致性的更稳健的图像-类别相似性度量标准来增强无分布样本与无分布样本之间的可分性。广泛的实验表明,SimLabel在各种零样本OD检测基准测试中表现出卓越的性能。该模型还扩展到各种VLM-backbone,显示出良好的泛化能力。我们的演示和实现代码均可在:https://github.com/ShuZou-1/SimLabel 获取。

关键词

引用

@article{arxiv.2501.11485,
  title  = {SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models},
  author = {Shu Zou and Xinyu Tian and Qinyu Zhao and Zhaoyuan Yang and Jing Zhang},
  journal= {arXiv preprint arXiv:2501.11485},
  year   = {2025}
}

备注

10 pages