FSD V2:利用虚拟体素改进全稀疏三维目标检测
计算机视觉与模式识别
2023-08-08 v1 机器人学
摘要
基于LiDAR的全稀疏架构已引起越来越多的关注。FSDv1作为代表性工作脱颖而出,取得了令人印象深刻的效能与效率,尽管其结构复杂且带有手工设计。在本文中,我们提出FSDv2,其演进旨在简化先前的FSDv1,同时消除其手工实例级表示所引入的归纳偏置,从而提升更好的通用适用性。为此,我们引入\textbf{虚拟体素}的概念,其接管了FSDv1中基于聚类的实例分割。虚拟体素不仅解决了全稀疏检测器中臭名昭著的Center Feature Missing(中心特征缺失)问题,还赋予该框架一种更为优雅且精简的途径。相应地,我们开发了一套组件以补充虚拟体素概念,包括虚拟体素编码器、虚拟体素混合器以及虚拟体素分配策略。通过实证验证,我们证明虚拟体素机制在功能上类似于FSDv1中的手工聚类,但更具通用性。我们在三个大规模数据集上进行了实验:Waymo Open Dataset、Argoverse 2 dataset和nuScenes dataset。我们的结果在所有三个数据集上展示了state-of-the-art性能,凸显了FSDv2在远距离场景中的优越性及其跨多样场景取得有竞争力性能的通用适用性。此外,我们提供了全面的实验分析以阐明FSDv2的工作机制。为促进可复现性与进一步研究,我们已在https://github.com/tusen-ai/SST开源FSDv2。
引用
@article{arxiv.2308.03755,
title = {FSD V2: Improving Fully Sparse 3D Object Detection with Virtual Voxels},
author = {Lue Fan and Feng Wang and Naiyan Wang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2308.03755},
year = {2023}
}