Graph-DETR3D:重新思考多视角 3D 目标检测中的重叠区域
计算机视觉与模式识别
2022-07-01 v3
摘要
从多张图像视角进行 3D 目标检测是视觉场景理解中一项基础且具有挑战性的任务。由于其低成本与高效率,多视角 3D 目标检测已展现出广阔的应用前景。然而,由于缺乏深度信息,通过透视视图在 3D 空间中准确检测物体极为困难。近来,DETR3D 引入了一种新颖的 3D-2D 查询范式来聚合多视角图像以进行 3D 目标检测,并取得了最先进的性能。在本文中,通过大量预实验,我们量化了位于不同区域的物体,并发现“截断实例”(即每张图像边界区域的物体)是阻碍 DETR3D 性能的主要瓶颈。尽管 DETR3D 在重叠区域合并了来自两个相邻视图的多个特征,其仍受限于特征聚合不足,从而错失了充分提升检测性能的机会。为解决该问题,我们提出 Graph-DETR3D,通过图结构学习(GSL)自动聚合多视角图像信息。它在每个目标查询与 2D 特征图之间构建动态 3D 图,以增强物体表示,尤其在边界区域。此外,Graph-DETR3D 得益于一种新颖的深度不变多尺度训练策略,该策略通过同时缩放图像尺寸与物体深度来保持视觉深度一致性。在 nuScenes 数据集上的大量实验证明了我们的 Graph-DETR3D 的有效性与高效性。值得注意的是,我们的最佳模型在 nuScenes 测试排行榜上取得了 49.5 NDS,与各类已发表的图像视角 3D 目标检测器相比实现了新的 SOTA。
引用
@article{arxiv.2204.11582,
title = {Graph-DETR3D: Rethinking Overlapping Regions for Multi-View 3D Object Detection},
author = {Zehui Chen and Zhenyu Li and Shiquan Zhang and Liangji Fang and Qinhong Jiang and Feng Zhao},
journal= {arXiv preprint arXiv:2204.11582},
year = {2022}
}
备注
Accepted to ACM MM 2022