TBP-Former:面向以视觉为中心的自动驾驶中联合感知与预测的时间鸟瞰图金字塔学习
计算机视觉与模式识别
2023-03-23 v2
摘要
以视觉为中心的联合感知与预测(PnP)已成为自动驾驶研究中的一个新兴趋势。它从原始RGB图像预测周围环境中交通参与者的未来状态。然而,由于不可避免的几何畸变,同步在多个相机视角与时间戳上获取的特征并进一步利用那些时空特征仍是一项关键挑战。为解决此问题,我们提出了一种用于以视觉为中心PnP的时间鸟瞰图金字塔Transformer(TBP-Former),其包含两项新颖设计。首先,提出位姿同步BEV编码器,将任意时刻任意相机位姿的原始图像输入映射到共享且同步的BEV空间,以实现更好的时空同步。其次,引入时空金字塔Transformer,在时空先验的支持下全面提取多尺度BEV特征并预测未来BEV状态。在nuScenes数据集上的大量实验表明,我们所提框架总体优于所有最先进的基于视觉的预测方法。
引用
@article{arxiv.2303.09998,
title = {TBP-Former: Learning Temporal Bird's-Eye-View Pyramid for Joint Perception and Prediction in Vision-Centric Autonomous Driving},
author = {Shaoheng Fang and Zi Wang and Yiqi Zhong and Junhao Ge and Siheng Chen and Yanfeng Wang},
journal= {arXiv preprint arXiv:2303.09998},
year = {2023}
}
备注
CVPR 2023