VoxelFormer:基于双视图注意力生成鸟瞰图特征的多视角3D目标检测
计算机视觉与模式识别
2023-04-04 v1
摘要
近年来,基于Transformer的检测器在2D视觉感知任务中展现出卓越性能。然而,它们在多视角3D目标检测中的表现仍逊于基于卷积神经网络的检测器最优方法(SOTA)。本文从鸟瞰图(BEV)特征生成的角度研究该问题。具体而言,我们考察了基于Transformer的SOTA方法BEVFormer所采用的BEV特征生成方法,并指出其两个局限:(i)仅从BEV生成注意力权重,无法利用激光雷达点进行监督;(ii)通过可变形采样将相机视图特征聚合到BEV,仅选取少量特征子集,未能利用全部信息。为克服这些局限,我们提出一种新颖的BEV特征生成方法——双视图注意力,它从BEV和相机视图共同生成注意力权重,将全部相机特征编码至BEV特征中。将双视图注意力与BEVFormer架构结合,我们构建了名为VoxelFormer的新检测器。在nuScenes基准上进行了大量实验以验证双视图注意力与VoxelFormer的优越性。我们注意到,即便训练时仅采用3个编码器和1个历史帧,VoxelFormer仍显著优于BEVFormer。在相同设置下训练时,VoxelFormer在NDS指标上可超越BEVFormer 4.9个百分点。代码见:https://github.com/Lizhuoling/VoxelFormer-public.git。
引用
@article{arxiv.2304.01054,
title = {VoxelFormer: Bird's-Eye-View Feature Generation based on Dual-view Attention for Multi-view 3D Object Detection},
author = {Zhuoling Li and Chuanrui Zhang and Wei-Chiu Ma and Yipin Zhou and Linyan Huang and Haoqian Wang and SerNam Lim and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2304.01054},
year = {2023}
}