中文

RTGen:实时生成式检测 Transformer

计算机视觉与模式识别 2025-11-18 v2

摘要

尽管开放词汇目标检测器能够泛化到未见类别,但它们在推理过程中仍然依赖于预定义的文本提示或分类器头。最近的生成式目标检测器通过将自回归语言模型与检测器骨干网络耦合来解决这一限制,从而能够为每个检测到的目标直接生成类别名称。然而,这种直接的设计引入了结构冗余和显著的延迟。在本文中,我们提出了实时生成式检测 Transformer(RTGen),一种具有简洁编码器-解码器架构的实时生成式目标检测器。具体而言,我们引入了一种新颖的区域-语言解码器(RL-Decoder),它在统一框架内联合解码视觉和文本表示。文本侧被组织为有向无环图(DAG),从而实现非自回归的类别命名。得益于这些设计,RTGen-R34 在 T4 GPU 上达到 131.3 FPS,比 GenerateU 快 270 倍以上。此外,我们的模型学会了直接从检测标签生成类别名称,而无需依赖 CLIP 或预训练语言模型等外部监督,实现了高效且灵活的开放式检测。

关键词

引用

@article{arxiv.2502.20622,
  title  = {RTGen: Real-Time Generative Detection Transformer},
  author = {Chi Ruan and Jiying Zhao and Wenhu Chen},
  journal= {arXiv preprint arXiv:2502.20622},
  year   = {2025}
}