中文

面向多类别3D动态物体检测与轨迹预测的高效激光雷达-摄像机融合网络

机器人学 2026-02-25 v2 人工智能 计算机视觉与模式识别

摘要

服务型移动机器人在执行任务时通常需要规避动态物体,但它们通常只有有限的计算资源。为进一步推动服务机器人在复杂动态环境中的实际应用,我们提出了一个高效的多模态框架,用于3D物体检测和轨迹预测,该框架协同集成激光雷达和摄像机输入,以实现对行人、车辆和骑行者在三维空间中进行实时感知。该框架包含两个新型模型:1)基于Mamba和Transformer的统一模态检测器(UniMT),实现高精度物体检测的同时具备快速推理速度;2)基于参考轨迹的多类别Transformer(RTMCT),实现对多类别物体进行高效且多样化轨迹预测,支持可变长度轨迹。在CODa基准测试中,我们的方法在检测(mAP提升3.71%)和轨迹预测(行人minADE5_5降低0.408m)等指标上均优于现有方法。此外,在具有挑战性的nuScenes检测基准测试中,我们的检测模型在激光雷达-摄像机融合方法中取得竞争成绩,mAP为72.7%,NDS为75.3%。值得注意的是,系统在配备入门级NVIDIA RTX 3060 GPU的轮椅机器人上实现了13.9帧/秒(FPS)的实时推理,同时保持满意的精度。为促进可重复性和实际部署,我们在 \href{https://github.com/TossherO/3D_Perception}{https://github.com/TossherO/3D\_Perception} 发布了相关代码,并在 \href{https://github.com/TossherO/ros_packages}{https://github.com/TossherO/ros\_packages} 发布了其ROS推理版本。

关键词

引用

@article{arxiv.2504.13647,
  title  = {An Efficient LiDAR-Camera Fusion Network for Multi-Class 3D Dynamic Object Detection and Trajectory Prediction},
  author = {Yushen He and Lei Zhao and Tianchen Deng and Zipeng Fang and Weidong Chen},
  journal= {arXiv preprint arXiv:2504.13647},
  year   = {2026}
}