中文

面向开放词汇目标检测的学习型检测与分割方法

计算机视觉与模式识别 2026-05-18 v7

摘要

视觉-语言预训练模型的最近发展极大地推动了开放词汇目标检测,其仅借助语义类别即可识别新颖物体。已有工作主要关注将知识迁移至目标候选框分类,并采用类别无关的框与掩码预测。本文提出 CondHead,一种原则性的动态网络设计,以更好地泛化开放词汇设定下的框回归与掩码分割。其核心思想是基于语义嵌入对网络头进行条件参数化,从而以类别特定知识引导模型更好地检测新颖类别。具体而言,CondHead 由两路网络头组成:动态聚合头与动态生成头。前者由一组静态头实例化并条件聚合,这些头作为专家优化,旨在学习精细预测;后者由动态生成参数实例化,编码通用的类别特定信息。借助此种条件设计,检测模型由语义嵌入桥接,提供强泛化能力的逐类框与掩码预测。我们的方法以极小开销显著改进最先进的开放词汇目标检测方法,例如,在新颖类别上以仅 1.1% 的额外计算量超越 RegionClip 模型 3.0 检测 AP。

关键词

引用

@article{arxiv.2212.12130,
  title  = {Learning to Detect and Segment for Open Vocabulary Object Detection},
  author = {Tao Wang and Nan Li},
  journal= {arXiv preprint arXiv:2212.12130},
  year   = {2026}
}

备注

We appologize that author Nan Li was not on the published version due to cvpr23 policy that authors cannot be added after abstract deadline