中文

OE-BevSeg:面向鸟瞰视角车辆语义分割的对象感知与环境感知多模态框架

计算机视觉与模式识别 2024-07-19 v1

摘要

鸟瞰视角(BEV)语义分割在自动驾驶系统中发挥着至关重要的作用。它通过将 2D 多视图图像投影到 3D 世界空间来实现对 ego-vehicle 周围环境的感知。近期 BEV 分割取得了显著进展,这主要归功于更好的视角转换模块、更大的图像编码器或更多的时序信息。然而,仍存在两个问题:1)缺乏有效的理解和强化 BEV 空间特征,尤其在准确捕捉长距离环境特征方面效果不佳;2)难以识别目标对象的细节。为此本文提出 OE-BevSeg,一个面向全局环境感知和局部目标增强的端到端多模态框架,通过增强 BEV 分割性能来实现上述目标。OE-BevSeg 采用环境感知 BEV 压缩器。基于关于 BEV 周围环境主要组成随距离区间增大而变化的先验知识,利用长序列全局建模来提高模型对环境的理解和感知能力。从丰富分割结果中目标对象信息的角度出发,本文引入中心感知对象增强模块,使用中心度信息对监督和引导分割头部,从局部增强视角提升分割性能。此外,本文设计了一种多模态融合分支,将多视图 RGB 图像特征与雷达/LiDAR 特征融合,显著提升了性能。广泛的实验表明,在仅使用摄像机或多模态融合的 BEV 分割任务中,我们的方法在 nuScenes 数据集上实现了车辆分割的状态突破性成果,显示出在自动驾驶领域的卓越适用性。

关键词

引用

@article{arxiv.2407.13137,
  title  = {OE-BevSeg: An Object Informed and Environment Aware Multimodal Framework for Bird's-eye-view Vehicle Semantic Segmentation},
  author = {Jian Sun and Yuqi Dai and Chi-Man Vong and Qing Xu and Shengbo Eben Li and Jianqiang Wang and Lei He and Keqiang Li},
  journal= {arXiv preprint arXiv:2407.13137},
  year   = {2024}
}