中文

为任意对象构建一类检测器:基于文本-图像模型的开放词汇零样本分布外检测

计算机视觉与模式识别 2023-05-30 v1

摘要

我们关注深度学习模型中分布外(OOD)检测的挑战,这是确保可靠性的关键方面。尽管已有大量努力,由于深度学习模型倾向于对OOD输入输出过度自信的预测,该问题仍极具挑战性。我们提出了一种新颖的一类开放集OOD检测器,它以零样本方式利用文本-图像预训练模型,并融合了对域内和OOD的多种描述。我们的方法旨在检测任何非域内的对象,并提供灵活检测各种OOD的能力,这些OOD可通过细粒度或粗粒度标签定义,甚至以自然语言定义。我们在具有挑战性的基准上评估了我们的方法,包括包含细粒度、语义相似类别的大规模数据集、分布偏移图像,以及包含域内与OOD对象混合的多对象图像。我们的方法在所有基准上均展现出优于先前方法的性能。代码见 https://github.com/gyhandy/One-Class-Anything

关键词

引用

@article{arxiv.2305.17207,
  title  = {Building One-class Detector for Anything: Open-vocabulary Zero-shot OOD Detection Using Text-image Models},
  author = {Yunhao Ge and Jie Ren and Jiaping Zhao and Kaifeng Chen and Andrew Gallagher and Laurent Itti and Balaji Lakshminarayanan},
  journal= {arXiv preprint arXiv:2305.17207},
  year   = {2023}
}

备注

16 pages (including appendix and references), 3 figures