BEVFormer:通过时空 Transformer 从多相机图像学习鸟瞰图表示
计算机视觉与模式识别
2022-07-14 v2
摘要
基于多相机图像的 3D 视觉感知任务,包括 3D 检测与地图分割,对自动驾驶系统至关重要。在本工作中,我们提出称为 BEVFormer 的新框架,其通过时空 transformers 学习统一的 BEV 表示,以支持多种自动驾驶感知任务。简而言之,BEVFormer 通过预定义的网格状 BEV 查询与空间和时间空间交互,利用空间与时间信息。为聚合空间信息,我们设计空间交叉注意力,使每个 BEV 查询从跨相机视图的兴趣区域提取空间特征。对于时间信息,我们提出时间自注意力以循环融合历史 BEV 信息。我们的方法在 nuScenes \texttt{test} 集上以 NDS 指标取得了 56.9% 的新最优性能,比先前最佳方法高 9.0 个点,并与基于 LiDAR 的基线性能相当。我们进一步展示 BEVFormer 显著提升了低能见度条件下速度估计的精度与物体的召回率。代码发布于 \url{https://github.com/zhiqi-li/BEVFormer}。
引用
@article{arxiv.2203.17270,
title = {BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers},
author = {Zhiqi Li and Wenhai Wang and Hongyang Li and Enze Xie and Chonghao Sima and Tong Lu and Qiao Yu and Jifeng Dai},
journal= {arXiv preprint arXiv:2203.17270},
year = {2022}
}
备注
Accepted to ECCV 2022