一种基于点的高效 LiDAR 多任务感知方法
计算机视觉与模式识别
2024-04-22 v1
摘要
与单任务网络相比,多任务网络有望提升性能和计算效率,从而促进在线部署。然而,当前点云感知中的多任务架构结合了多个特定任务的点云表示,每个表示都需要单独的特征编码器,使得网络结构臃肿且缓慢。我们提出了 PAttFormer,这是一种用于点云中联合语义分割和目标检测的高效多任务架构,仅依赖于基于点的表示。该网络建立在基于 Transformer 的特征编码器(使用邻域注意力和网格池化)以及基于查询的检测解码器(使用新型 3D 可变形注意力检测头设计)之上。与其他基于 LiDAR 的多任务架构不同,我们提出的 PAttFormer 不需要为多个特定任务的点云表示提供单独的特征编码器,使得网络体积缩小 3 倍、速度提升 1.4 倍,同时在用于自动驾驶感知的 nuScenes 和 KITTI 基准上取得了具有竞争力的性能。我们的广泛评估表明,多任务学习带来了显著收益,与单任务模型相比,在 nuScenes 基准上 LiDAR 语义分割的 mIoU 提升了 +1.7%,3D 目标检测的 mAP 提升了 +1.7%。
引用
@article{arxiv.2404.12798,
title = {A Point-Based Approach to Efficient LiDAR Multi-Task Perception},
author = {Christopher Lang and Alexander Braun and Lars Schillingmann and Abhinav Valada},
journal= {arXiv preprint arXiv:2404.12798},
year = {2024}
}
备注
8 pages, 3 figures, 8 tables