中文

面向LiDAR语义分割的高效极坐标-笛卡尔 BEV 深度融合框架

计算机视觉与模式识别 2024-12-20 v1

摘要

虽然多视图融合在LiDAR分割中显示出潜力,但由于缺乏视图之间固定对应关系(例如范围视图和鸟瞰图 (BEV) 之间),导致基于点的数据交互计算开销巨大,阻碍了实际部署。本文挑战了多视图融合是实现高性能所必需的常规观念。我们展示,通过直接在BEV空间内融合极坐标和笛卡尔分区策略,可实现显著提升。我们提出的仅使用BEV的分割模型利用这两种分区方案之间固有的固定网格对应关系,实现了比传统点基方法快一个数量级(170倍加速)的融合过程。此外,我们的方法还利于密集特征融合,保留了比稀疏点基替代方案更丰富的上下文信息。为在保持推理效率的同时增强场景理解,我们还引入了混合Transformer-CNN架构。在SemanticKITTI和nuScenes数据集上的广泛评估提供了有力证据,表明该方法在性能和推理速度方面均优于以前的多视图融合方法,凸显了基于BEV的LiDAR分割潜力。代码地址为\url{https://github.com/skyshoumeng/PC-BEV.}

关键词

引用

@article{arxiv.2412.14821,
  title  = {PC-BEV: An Efficient Polar-Cartesian BEV Fusion Framework for LiDAR Semantic Segmentation},
  author = {Shoumeng Qiu and Xinrun Li and XiangYang Xue and Jian Pu},
  journal= {arXiv preprint arXiv:2412.14821},
  year   = {2024}
}

备注

AAAI 2025