中文

3DMOTFormer: 用于在线三维多目标跟踪的图 Transformer

计算机视觉与模式识别 2023-08-15 v1

摘要

准确且一致地跟踪三维物体对自动驾驶车辆至关重要, 可赋能轨迹预测与运动规划等更可靠的下游任务。基于近年来物体检测的巨大进展, 检测即跟踪范式因其简洁与高效已成为流行选择。最先进的三维多目标跟踪(MOT)方法通常依赖卡尔曼滤波等非学习基于模型的算法, 但需大量手动调参。另一方面, 基于学习的方法面临将训练适配到在线设置的问题, 导致训练与推理间不可避免的分布式失配及次优性能。本工作中, 我们提出 3DMOTFormer, 一种构建于 Transformer 架构之上的基于几何的学习型三维 MOT 框架。我们使用边增强图 Transformer 逐帧推理跟踪-检测二部图, 并通过边分类进行数据关联。为减小训练与推理间的分布式失配, 我们提出一种新颖的在线训练策略, 具有自回归与循环前向传播以及序列批优化。使用 CenterPoint 检测, 我们的方法在 nuScenes 验证集与测试集上分别达到 71.2% 与 68.2% 的 AMOTA。此外, 训练好的 3DMOTFormer 模型在不同物体检测器间具有良好的泛化能力。代码见: https://github.com/dsx0511/3DMOTFormer。

关键词

引用

@article{arxiv.2308.06635,
  title  = {3DMOTFormer: Graph Transformer for Online 3D Multi-Object Tracking},
  author = {Shuxiao Ding and Eike Rehder and Lukas Schneider and Marius Cordts and Juergen Gall},
  journal= {arXiv preprint arXiv:2308.06635},
  year   = {2023}
}

备注

17 pages, 8 figures, accepted by ICCV2023