Time3D:面向自动驾驶的端到端联合单目三维目标检测与跟踪
计算机视觉与模式识别
2022-05-31 v1
摘要
虽然分别利用单目三维目标检测与二维多目标跟踪可直截了当地以逐帧方式应用于序列图像,但独立的跟踪器切断了从三维检测器到跟踪的不确定性传递,且无法将跟踪误差微分回传至三维检测器。在本工作中,我们提出以端到端方式仅从单目视频联合训练三维检测与三维跟踪。关键组件是一个新颖的时空信息流模块,其聚合几何与外观特征以预测当前与过往帧中所有对象的鲁棒相似度分数。具体而言,我们利用transformer的注意力机制,其中自注意力聚合特定帧中的空间信息,交叉注意力挖掘序列帧时间域中所有对象的关系与亲和性。这些亲和性随后被监督以估计轨迹并引导信息在对应三维对象间的流动。此外,我们提出一种时间一致性损失,将三维目标运动建模显式引入学习中,使三维轨迹在世界坐标系下平滑。Time3D在nuScenes三维跟踪基准上取得21.4% AMOTA、13.6% AMOTP,超越所有已发表竞争者,并以38 FPS运行,同时Time3D在nuScenes三维检测基准上取得31.2% mAP、39.4% NDS。
引用
@article{arxiv.2205.14882,
title = {Time3D: End-to-End Joint Monocular 3D Object Detection and Tracking for Autonomous Driving},
author = {Peixuan Li and Jieyu Jin},
journal= {arXiv preprint arXiv:2205.14882},
year = {2022}
}
备注
Accepted to CVPR 2022