中文

从开放词汇表到开放世界:教会视觉语言模型检测新颖对象

计算机视觉与模式识别 2026-02-27 v4 人工智能

摘要

传统对象检测方法在封闭集假设下运行,模型只能检测训练集中预定义的固定数量的对象。最近的开放词汇表对象检测 (OVD)工作使能够检测由原则上不可限定的词汇表定义的对象,这减少了为特定任务训练模型的成本。然而,OVD高度依赖于由"oracle"提供的准确提示,这限制了其在如驾驶场景感知等关键应用中的使用。OVD模型倾向于误分类具有类似已知类别特征的靠近分布外 (NOOD)对象,忽略分布外 (FOOD)对象。为解决这些限制,我们提出了一个框架,使OVD模型能够在开放世界环境中运行,通过识别和逐步学习以前未见过的对象来实现。为检测FOOD对象,我们提出了开放世界嵌入学习 (OWEL)并引入了伪未知嵌入 (Pseudo Unknown Embedding)的概念,该概念基于已知类的信息推断未知类别在连续语义空间中的位置。我们还提出了多尺度对比锚点学习 (MSCAL),该方法通过在不同尺度上促进对象嵌入的类内一致性来识别误分类的未知对象。所提出的方法在标准开放世界对象检测和自动驾驶基准测试中实现了最先进的性能,同时保持其开放词汇表对象检测能力。

关键词

引用

@article{arxiv.2411.18207,
  title  = {From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects},
  author = {Zizhao Li and Zhengkang Xiang and Joseph West and Kourosh Khoshelham},
  journal= {arXiv preprint arXiv:2411.18207},
  year   = {2026}
}

备注

Accepted by BMVC 2025