LiDAR-BEVMTN:面向自动驾驶的实时激光雷达鸟瞰图多任务感知网络
计算机视觉与模式识别
2024-11-20 v2 机器人学
摘要
激光雷达对于自动驾驶中鲁棒的3D场景感知至关重要。继相机感知之后,激光雷达感知拥有最庞大的文献体量。然而,利用激光雷达在检测、分割和运动估计等任务间进行多任务学习仍相对未被充分探索,尤其是在车载级嵌入式平台上。我们提出了一种用于基于激光雷达的目标检测、语义分割和运动分割的实时多任务卷积神经网络。该统一架构由共享编码器和任务特定解码器组成,支持联合表征学习。我们提出了一种新颖的语义加权与引导(Semantic Weighting and Guidance, SWAG)模块,以选择性地迁移语义特征从而改进目标检测。我们的异构训练方案结合了多样化数据集,并利用任务间的互补线索。该工作提供了首个从激光雷达点云统一这些关键感知任务的嵌入式实现,在嵌入式NVIDIA Xavier平台上达到3ms延迟。我们在两项任务(语义分割和运动分割)上取得了最先进(state-of-the-art, SOTA)结果,并在3D目标检测上取得了接近SOTA的性能。通过最大化硬件效率并利用多任务协同效应,我们的方法提供了一种为真实世界自动驾驶部署量身定制的准确且高效的解决方案。定性结果可见 https://youtu.be/H-hWRzv2lIY。
引用
@article{arxiv.2307.08850,
title = {LiDAR-BEVMTN: Real-Time LiDAR Bird's-Eye View Multi-Task Perception Network for Autonomous Driving},
author = {Sambit Mohapatra and Senthil Yogamani and Varun Ravi Kumar and Stefan Milz and Heinrich Gotzig and Patrick Mäder},
journal= {arXiv preprint arXiv:2307.08850},
year = {2024}
}
备注
Accepted for publication at IEEE Transactions on Intelligent Transportation Systems