少感知,多生成:基于掩码自编码器的激光雷达感知预训练,以实现超高效 3D 测感
计算机视觉与模式识别
2024-06-13 v1 人工智能
摘要
本 work 提出一种颠覆性节约的激光雷达感知数据流,通过生成而非直接感知环境中可基于训练数据预测或对整体预测精度影响有限的部分。因此,该方法以牺牲感知能耗为代价,以换取训练数据,从而实现低功耗机器人和自动导航在传感器上的节能运行,延长单次充电的使用寿命。我们提出的生成式预训练策略称为 radially masked autoencoding(R-MAE),可在典型激光雷达系统中通过在现场操作期间 selectively 激活和控制随机生成的角向区域的激光功率来实现。我们的广泛评估表明,R-MAE 预训练使模型能够聚焦于数据的最 radial 片段,从而比传统方法更有效地捕捉物体之间的空间关系和距离。因此,该方法不仅减少感知能耗,还提升预测精度。例如,在 Waymo、nuScenes 和 KITTI 数据集上的评估显示,该方法在检测任务中实现了超过 5% 的平均精度提升,跨域迁移(Waymo 和 nuScenes 至 KITTI)精度提升超过 4%。在 3D 目标检测中,能使小目标检测在 KITTI 数据集中 moderate 难度水平下提升最高达 4.37% 的 AP。即便在 90% radial masking 下,仍能在 Waymo 数据集中所有目标类别的 mAP/mAPH 超越基线模型最高达 5.59%。此外,该方法在 nuScenes 数据集上实现了最高达 3.17% 和 2.31% 的 mAP 和 NDS 提升,证明其在单模态和融合 LiDAR 摄像机模态下的有效性。
引用
@article{arxiv.2406.07833,
title = {Sense Less, Generate More: Pre-training LiDAR Perception with Masked Autoencoders for Ultra-Efficient 3D Sensing},
author = {Sina Tayebati and Theja Tulabandhula and Amit R. Trivedi},
journal= {arXiv preprint arXiv:2406.07833},
year = {2024}
}