M3DeTR:基于 Transformer 的多表示、多尺度、互关系三维目标检测
计算机视觉与模式识别
2021-10-26 v3
摘要
我们提出一种用于三维目标检测的新架构 M3DeTR,它基于多尺度特征金字塔,将不同的点云表示(原始点、体素、鸟瞰图)与不同的特征尺度相结合。M3DeTR 是首个利用 transformers 同时统一多种点云表示、特征尺度并建模点云间互关系的方法。我们进行了大量消融实验,凸显了融合表示与尺度以及建模关系的益处。我们的方法在 KITTI 三维目标检测数据集与 Waymo Open Dataset 上取得了最先进的性能。结果表明,M3DeTR 在 Waymo Open Dataset 上对所有类别以 1.48% mAP 显著优于基线。特别地,我们的方法在知名的 KITTI 三维检测基准上针对汽车与自行车类别均排名第 1,并以单帧点云输入在 Waymo Open Dataset 上排名第 1。我们的代码见:https://github.com/rayguan97/M3DETR。
引用
@article{arxiv.2104.11896,
title = {M3DeTR: Multi-representation, Multi-scale, Mutual-relation 3D Object Detection with Transformers},
author = {Tianrui Guan and Jun Wang and Shiyi Lan and Rohan Chandra and Zuxuan Wu and Larry Davis and Dinesh Manocha},
journal= {arXiv preprint arXiv:2104.11896},
year = {2021}
}