LiDARFormer:一种基于Transformer的统一多任务LiDAR感知网络
计算机视觉与模式识别
2024-03-05 v2
摘要
近期LiDAR感知领域呈现出将多个任务统一于单一强网络以提升性能的趋势,而非为每个任务使用独立网络。本文提出一种基于transformer的LiDAR多任务学习新范式。所提LiDARFormer利用跨空间全局上下文特征信息,并借助跨任务协同提升在多个大规模数据集与基准上LiDAR感知任务的性能。我们新颖的基于transformer的框架包含一个跨空间transformer模块,该模块学习2D稠密鸟瞰图(BEV)与3D稀疏体素特征图之间的注意力特征。此外,我们为分割任务提出一个transformer解码器,通过利用类别特征表示动态调节所学特征。进而,我们在共享transformer解码器中结合分割与检测特征并引入跨任务注意力层,以增强并整合目标级与类别级特征。LiDARFormer在大规模nuScenes与Waymo Open数据集上针对3D检测与语义分割任务进行评估,并在两项任务上均优于此前所有已发表方法。值得注意的是,作为单一模型仅用LiDAR的方法,LiDARFormer在具挑战性的Waymo与nuScenes检测基准上分别取得76.4% L2 mAPH与74.3% NDS的SOTA性能。
引用
@article{arxiv.2303.12194,
title = {LiDARFormer: A Unified Transformer-based Multi-task Network for LiDAR Perception},
author = {Zixiang Zhou and Dongqiangzi Ye and Weijia Chen and Yufei Xie and Yu Wang and Panqu Wang and Hassan Foroosh},
journal= {arXiv preprint arXiv:2303.12194},
year = {2024}
}
备注
ICRA 2024