CAMO-MOT:基于相机-激光雷达融合与表观-运动联合优化的三维多目标跟踪
计算机视觉与模式识别
2022-09-13 v3
摘要
三维多目标跟踪(MOT)在连续动态检测中保证一致性,有利于自动驾驶中后续的 motion planning 与导航任务。然而,基于相机的方法在遮挡情况下表现不佳,而基于 LiDAR 的方法难以准确跟踪物体的不规则运动。一些融合方法表现良好,但未考虑遮挡下表观特征不可靠的问题。同时,误检测问题也显著影响跟踪。为此,我们提出一种新颖的基于相机-激光雷达融合的三维 MOT 框架,即表观-运动联合优化(CAMO-MOT),其利用相机与 LiDAR 数据,显著减少了由遮挡和误检测引起的跟踪失败。针对遮挡问题,我们首次提出一个遮挡头,多次有效筛选最佳物体表观特征,降低遮挡影响。为减小跟踪中误检测的影响,我们设计了一个基于置信度分数的运动代价矩阵,提升了三维空间中的定位与物体预测精度。鉴于现有多目标跟踪方法仅考虑单一类别,我们还提出构建多类别损失,以在多类别场景中实现多目标跟踪。我们在 KITTI 与 nuScenes 跟踪基准上进行了一系列验证实验。所提方法在 KITTI 测试集上于所有多模态 MOT 方法中取得了 SOTA 性能与最低的身份切换(IDS)值(Car 为 23,Pedestrian 为 137);在 nuScenes 测试集上以 75.3% AMOTA 在所有算法中取得 SOTA 性能。
引用
@article{arxiv.2209.02540,
title = {CAMO-MOT: Combined Appearance-Motion Optimization for 3D Multi-Object Tracking with Camera-LiDAR Fusion},
author = {Li Wang and Xinyu Zhang and Wenyuan Qin and Xiaoyu Li and Lei Yang and Zhiwei Li and Lei Zhu and Hong Wang and Jun Li and Huaping Liu},
journal= {arXiv preprint arXiv:2209.02540},
year = {2022}
}
备注
Based on this work, we achieved 1st place on the nuScenes tracking leaderboard