中文

MonoDTR:基于深度感知Transformer的单目三维目标检测

计算机视觉与模式识别 2022-03-29 v2

摘要

单目三维目标检测是自动驾驶中一项重要且具有挑战性的任务。一些现有方法利用现成深度估计器提供的深度信息来辅助三维检测,但受到额外计算负担以及不准确深度先验所导致的有限性能的困扰。为缓解此问题,我们提出 MonoDTR,一种新颖的用于单目三维目标检测的深度感知端到端Transformer网络。它主要由两个组件构成:(1) 深度感知特征增强(DFE)模块,该模块在辅助监督下隐式学习深度感知特征而无需额外计算;(2) 深度感知Transformer(DTR)模块,该模块全局整合上下文与深度感知特征。此外,不同于传统的逐像素位置编码,我们引入一种新颖的深度位置编码(DPE),将深度位置提示注入Transformer。我们提出的深度感知模块可轻松插入现有的仅图像单目三维目标检测器以提升性能。在 KITTI 数据集上的大量实验表明,我们的方法优于先前最先进的基于单目的方法,并实现了实时检测。代码见 https://github.com/kuanchihhuang/MonoDTR

关键词

引用

@article{arxiv.2203.10981,
  title  = {MonoDTR: Monocular 3D Object Detection with Depth-Aware Transformer},
  author = {Kuan-Chih Huang and Tsung-Han Wu and Hung-Ting Su and Winston H. Hsu},
  journal= {arXiv preprint arXiv:2203.10981},
  year   = {2022}
}

备注

Accepted to CVPR 2022