从视频中以 3D 表示跟踪目标
计算机视觉与模式识别
2023-06-09 v1
摘要
由于目标遮挡,数据关联是 2D 多目标跟踪(MOT)中的一个难题。然而,在 3D 空间中,数据关联并不那么困难。仅借助 3D 卡尔曼滤波器,在线目标跟踪器便可关联来自 LiDAR 的检测。在本文中,我们重新思考 2D MOT 中的数据关联,并利用 3D 目标表示在特征空间中分离各个目标。与现有的基于深度的 MOT 方法不同,3D 目标表示可与目标关联模块联合学习。此外,目标的 3D 表示从视频中学习,并由 2D 跟踪标签监督,无需来自 LiDAR 或预训练深度估计器的额外人工标注。通过从单目视频中的伪 3D 目标标签学习 3D 目标表示,我们提出了一种称为 P3DTrack 的新 2D MOT 范式。大量实验展示了我们方法的有效性。我们在大规模 Waymo Open Dataset 上取得了新的最先进性能。
引用
@article{arxiv.2306.05416,
title = {Tracking Objects with 3D Representation from Videos},
author = {Jiawei He and Lue Fan and Yuqi Wang and Yuntao Chen and Zehao Huang and Naiyan Wang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2306.05416},
year = {2023}
}
备注
Technical report