基于相机图像与激光雷达点云时空表示的联合三维目标检测与跟踪
计算机视觉与模式识别
2021-12-16 v2 机器学习
摘要
本文提出了一种基于相机与激光雷达传感器的新型联合目标检测与跟踪(JoDT)框架,用于三维目标检测与跟踪。所提方法称为 3D DetecTrack,使检测器与跟踪器协作生成相机与激光雷达数据的时空表示,并据此执行三维目标检测与跟踪。检测器通过对相机与激光雷达融合所得空间特征进行加权时间聚合来构建时空特征;随后,检测器利用截至前一时间步所维护的轨迹片段(tracklets)信息对初始检测结果进行重构。基于检测器生成的时空特征,跟踪器使用图神经网络(GNN)将检测到的目标与先前跟踪的目标进行关联。我们设计了一种由基于规则的边剪枝与基于注意力的边门控相结合的完全连接 GNN,其利用空间与时间目标上下文来提升跟踪性能。在 KITTI 与 nuScenes 基准上的实验表明,所提 3D DetecTrack 在检测与跟踪性能上较基线方法均有显著提升,并通过检测器与跟踪器间的协作在现有方法中达到最先进的性能。
引用
@article{arxiv.2112.07116,
title = {Joint 3D Object Detection and Tracking Using Spatio-Temporal Representation of Camera Image and LiDAR Point Clouds},
author = {Junho Koh and Jaekyum Kim and Jinhyuk Yoo and Yecheol Kim and Dongsuk Kum and Jun Won Choi},
journal= {arXiv preprint arXiv:2112.07116},
year = {2021}
}