BOTT:用于三维目标跟踪的仅边界框 Transformer 跟踪器
计算机视觉与模式识别
2023-08-21 v1
摘要
跟踪三维目标是自动驾驶中的一项重要任务。经典的基于卡尔曼滤波的方法仍是最流行的解决方案。然而,这些方法需要在运动建模中进行手工设计,且无法从不断增长的数据量中获益。本文提出 Box Only Transformer Tracker (BOTT),通过将时间窗口内的所有三维边界框作为输入,学习将同一物体在不同帧中的三维框进行关联。具体而言,应用 Transformer 自注意力在所有边界框之间交换信息,以学习具有全局信息的框嵌入。这些学习到的嵌入之间的相似度可用于关联同一物体的边界框。BOTT 可无缝用于在线和离线跟踪模式。其简洁性使我们能够显著减少传统基于卡尔曼滤波方法所需的工程工作量。实验表明,BOTT 在两个最大的三维多目标跟踪(MOT)基准上取得了具有竞争力的性能:在 nuScenes 验证集和测试集上分别达到 69.9 和 66.7 AMOTA,在 Waymo Open Dataset 验证集和测试集上分别达到 56.45 和 59.57 MOTA L2。本工作表明,通过使用 Transformer 直接从三维边界框学习特征来跟踪三维目标是一种简单而有效的方法。
引用
@article{arxiv.2308.08753,
title = {BOTT: Box Only Transformer Tracker for 3D Object Tracking},
author = {Lubing Zhou and Xiaoli Meng and Yiluan Guo and Jiong Yang},
journal= {arXiv preprint arXiv:2308.08753},
year = {2023}
}