面向多模态三维目标检测的虚拟稀疏卷积
计算机视觉与模式识别
2023-03-07 v1
摘要
近年来,通过深度补全无缝融合 RGB 图像与 LiDAR 数据的基于虚拟/伪点的三维目标检测受到了极大关注。然而,由图像生成的虚拟点非常密集,在检测过程中引入了海量冗余计算。同时,不准确的深度补全所带来的噪声显著降低了检测精度。本文提出一种快速而有效的骨干网络 VirConvNet,其基于一种新算子 VirConv(虚拟稀疏卷积),用于基于虚拟点的三维目标检测。VirConv 包含两个关键设计:(1) StVD(随机体素丢弃)与 (2) NRConv(抗噪子流形卷积)。StVD 通过丢弃大量邻近冗余体素来缓解计算问题。NRConv 通过在 2D 图像与 3D LiDAR 空间中编码体素特征来解决噪声问题。通过集成 VirConv,我们首先基于早期融合设计开发了高效流水线 VirConv-L。随后,我们基于变换细化方案构建了高精度流水线 VirConv-T。最后,我们基于伪标签框架开发了半监督流水线 VirConv-S。在 KITTI 汽车三维检测测试排行榜上,我们的 VirConv-L 以 56ms 的快速运行速度达到了 85% AP。我们的 VirConv-T 与 VirConv-S 分别达到了 86.3% 与 87.2% AP 的高精度,目前分别排名第 2 与第 1。代码见 https://github.com/hailanyi/VirConv。
引用
@article{arxiv.2303.02314,
title = {Virtual Sparse Convolution for Multimodal 3D Object Detection},
author = {Hai Wu and Chenglu Wen and Shaoshuai Shi and Xin Li and Cheng Wang},
journal= {arXiv preprint arXiv:2303.02314},
year = {2023}
}
备注
Accepted by CVPR 2023