UniSeg:一种统一的多模态激光雷达分割网络及 OpenPCSeg 代码库
计算机视觉与模式识别
2023-09-12 v1
摘要
点视图、体素视图和距离视图是点云的三种代表性形式。它们都具有精确的三维测量但缺乏颜色与纹理信息。RGB 图像是这些点云视图的自然补充,充分利用它们的综合信息有助于更鲁棒的感知。本文提出一种统一的多模态激光雷达分割网络,称为 UniSeg,其利用 RGB 图像与点云三种视图的信息,并同时完成语义分割与全景分割。具体而言,我们首先设计可学习的跨模态关联(LMA)模块,将体素视图与距离视图特征同图像特征自动融合,充分利用图像丰富的语义信息且对标定误差具有鲁棒性。随后,增强后的体素视图与距离视图特征被变换至点空间,在此通过点云三视图特征的可学习跨视图关联模块(LVA)进一步自适应融合。值得注意的是,UniSeg 在三个公开基准(即 SemanticKITTI、nuScenes 和 Waymo Open Dataset (WOD))上取得了有前景的结果;其在两个基准的两项挑战中排名首位,包括 nuScenes 的激光雷达语义分割挑战与 SemanticKITTI 的全景分割挑战。此外,我们构建了 OpenPCSeg 代码库,这是最大且最全面的外界激光雷达分割代码库。它包含大多数流行的室外激光雷达分割算法并提供可复现的实现。OpenPCSeg 代码库将于 https://github.com/PJLab-ADG/PCSeg 公开。
引用
@article{arxiv.2309.05573,
title = {UniSeg: A Unified Multi-Modal LiDAR Segmentation Network and the OpenPCSeg Codebase},
author = {Youquan Liu and Runnan Chen and Xin Li and Lingdong Kong and Yuchen Yang and Zhaoyang Xia and Yeqi Bai and Xinge Zhu and Yuexin Ma and Yikang Li and Yu Qiao and Yuenan Hou},
journal= {arXiv preprint arXiv:2309.05573},
year = {2023}
}
备注
ICCV 2023; 21 pages; 9 figures; 18 tables; Code at https://github.com/PJLab-ADG/PCSeg