中文

DetRefiner:基于特征融合 Transformer 的模型无关检测精修

计算机视觉与模式识别 2026-05-12 v1

摘要

开放词汇目标检测(OVOD)旨在检测已见和未见类别,然而由于对全局和局部上下文线索的整合有限,现有方法通常难以泛化到新物体。我们提出了 DetRefiner,一个简单而有效的即插即用框架,它学习融合全局和局部特征以精修开放词汇检测。DetRefiner 通过轻量级 Transformer 编码器处理来自基础模型(例如 DINOv3)的全局图像特征和块级图像特征。该编码器生成捕捉图像级属性的类向量和表示局部区域属性的块向量,从中推断属性可靠性以重新校准基础模型的置信度。值得注意的是,DetRefiner 的训练独立于基础 OVOD 模型,既不需要访问其内部特征,也不需要重新训练。在推理时,它仅基于基础检测器的预测进行操作,生成辅助校准分数,并与基础检测器的分数合并以产生最终精修的置信度。尽管如此简单,DetRefiner 在 COCO、LVIS、ODinW13 和 Pascal VOC 上持续增强了多个 OVOD 模型,在未见类别上实现了高达 +10.1 AP 的增益。这些结果突显了学习融合全局和局部表示为推进开放世界目标检测提供了一种强大且通用的机制。我们的代码和模型可在 https://github.com/hitachi-rd-cv/detrefiner 获取。

关键词

引用

@article{arxiv.2605.10190,
  title  = {DetRefiner: Model-Agnostic Detection Refinement with Feature Fusion Transformer},
  author = {Soichiro Okazaki and Tatsuya Sasaki and Hiroki Ohashi},
  journal= {arXiv preprint arXiv:2605.10190},
  year   = {2026}
}

备注

CVPR 2026 Findings