中文

FutrTrack:用于3D多目标跟踪的基于相机-LiDAR融合的Transformer

计算机视觉与模式识别 2025-12-17 v2

摘要

我们提出了FutrTrack,一个模块化的相机-LiDAR多目标跟踪框架,它基于现有的3D检测器,引入了基于Transformer的平滑器和融合驱动的跟踪器。受查询式跟踪框架的启发,FutrTrack采用多模态两阶段Transformer细化和跟踪管线。我们的融合跟踪器将边界框与来自多个相机和LiDAR的多模态鸟瞰视图(BEV)融合特征进行整合,无需显式的运动模型。跟踪器在帧之间分配并传递身份标识,利用几何和语义线索,在遮挡和视角变化的情况下实现稳健的重识别。在跟踪之前,我们通过在移动窗口上的时间平滑器对边界框序列进行细化,以细化轨迹、减少抖动并提高空间一致性。在nuScenes和KITTI上进行的评估表明,查询式Transformer跟踪方法在多模态传感器特征方面显著优于以前的单传感器方法。在nuScenes测试集上实现74.7的aMOTA,FutrTrack在3D MOT基准测试中取得了强性能,同时减少了身份切换,保持了竞争性的精度。我们的做法提供了一个高效的框架,用于提升基于Transformer的跟踪器性能,以便在有限数据且无需预训练的情况下与其他神经网络方法竞争。

关键词

引用

@article{arxiv.2510.19981,
  title  = {FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking},
  author = {Martha Teiko Teye and Ori Maoz and Matthias Rottmann},
  journal= {arXiv preprint arXiv:2510.19981},
  year   = {2025}
}

备注

Accepted to VISAPP 2026