通过预测物体运动学习时间线索用于多相机3D目标检测
计算机视觉与模式识别
2024-04-03 v1
摘要
在自动驾驶和机器人领域,利用短期历史数据增强多相机3D目标检测的兴趣日益增长,这得益于输入视频流的连续性和相关性。最近的工作集中在时间步上对基于BEV的特征进行空间对齐。然而,这通常受到限制,因为其增益不能很好地随长期历史观测扩展。为了解决这个问题,我们主张监督模型根据过去观测预测物体姿态,从而明确引导学习物体的时间线索。为此,我们提出一个名为DAP(预测后检测)的模型,包含一个双分支网络:(i)一个分支负责根据过去观测预测当前物体姿态;(ii)另一个分支基于当前和过去观测检测物体。将分支(i)预测当前物体的特征融合到分支(ii)中以传递预测知识。我们在大规模nuScenes数据集上进行了大量实验,观察到利用这种预测信息显著提高了整体检测性能。我们的模型可以即插即用,显示出一致的性能提升。
引用
@article{arxiv.2404.01580,
title = {Learning Temporal Cues by Predicting Objects Move for Multi-camera 3D Object Detection},
author = {Seokha Moon and Hongbeen Park and Jungphil Kwon and Jaekoo Lee and Jinkyu Kim},
journal= {arXiv preprint arXiv:2404.01580},
year = {2024}
}