中文

Co-Occ:耦合显式特征融合与体渲染正则化的多模态 3D 语义占据预测

计算机视觉与模式识别 2024-05-24 v3

摘要

3D 语义占据预测是自动驾驶领域的一项关键任务。近期的方法在单模态 3D 语义占据预测方面取得了很大进展。然而,多模态语义占据预测方法在处理不同模态数据融合过程中出现的模态异构性、模态未对齐以及模态交互不充分等问题时遇到了困难,这可能导致重要的几何和语义信息丢失。本文提出了一种新颖的多模态(即 LiDAR-相机)3D 语义占据预测框架,称为 Co-Occ,它将显式 LiDAR-相机特征融合与隐式体渲染正则化相耦合。其关键洞察在于,特征空间中的体渲染能够有效地弥合 3D LiDAR 扫描与 2D 图像之间的差距,同时作为物理正则化来增强 LiDAR-相机融合的体素表示。具体而言,我们首先提出一个几何与语义感知融合(GSFusion)模块,通过 K 近邻(KNN)搜索合并相邻相机特征来显式增强 LiDAR 特征。然后,我们采用体渲染将融合特征投影回图像平面,以重建彩色图和深度图。这些图分别由相机的输入图像和从 LiDAR 导出的深度估计进行监督。在流行的 nuScenes 和 SemanticKITTI 基准上的大量实验验证了我们 Co-Occ 在 3D 语义占据预测中的有效性。项目页面可在 https://rorisis.github.io/Co-Occ_project-page/ 获取。

关键词

引用

@article{arxiv.2404.04561,
  title  = {Co-Occ: Coupling Explicit Feature Fusion with Volume Rendering Regularization for Multi-Modal 3D Semantic Occupancy Prediction},
  author = {Jingyi Pan and Zipeng Wang and Lin Wang},
  journal= {arXiv preprint arXiv:2404.04561},
  year   = {2024}
}

备注

Accepted by IEEE Robotics and Automation Letters (RA-L)