V-DETR:采用顶点相对位置编码的 DETR 三维目标检测模型
计算机视觉与模式识别
2023-08-09 v1
摘要
我们引入了一种基于 DETR 框架、面向点云的高性能三维目标检测器。此前的尝试均取得次优结果,因为它们未能从有限规模的训练数据中学习到准确的归纳偏置。具体而言,查询常关注远离目标物体的点,违背了目标检测中的局部性原理。为克服该局限,我们提出一种新颖的三维顶点相对位置编码(3DV-RPE)方法,该方法根据每个点相对于各解码器层中查询所预测三维框的相对位置计算位置编码,从而提供清晰信息引导模型聚焦于物体附近的点,符合局部性原理。此外,基于我们对任务的理解,我们从数据归一化等多方面系统性改进了流程。我们在具挑战性的 ScanNetV2 基准上展示了优异结果,在 / 上相对先前 3DETR 分别从 65.0%/47.0% 显著提升至 77.8%/66.0%。此外,我们的方法在 ScanNetV2 与 SUN RGB-D 数据集上创下新纪录。代码将发布于 http://github.com/yichaoshen-MS/V-DETR。
引用
@article{arxiv.2308.04409,
title = {V-DETR: DETR with Vertex Relative Position Encoding for 3D Object Detection},
author = {Yichao Shen and Zigang Geng and Yuhui Yuan and Yutong Lin and Ze Liu and Chunyu Wang and Han Hu and Nanning Zheng and Baining Guo},
journal= {arXiv preprint arXiv:2308.04409},
year = {2023}
}