SLCF-Net: 使用 3D 循环 U-Net 的序列 LiDAR-相机融合语义场景补全
计算机视觉与模式识别
2024-03-15 v1 人工智能
机器人学
摘要
我们提出了 SLCF-Net,一种用于语义场景补全(Semantic Scene Completion, SSC)任务的新方法,该方法按序列融合 LiDAR 与相机数据。它从 RGB 图像序列与稀疏 LiDAR 测量值中联合估计场景中缺失的几何与语义信息。图像由预训练的 2D U-Net 进行语义分割,并通过由 Depth Anything 驱动的深度条件化管线估计稠密深度先验。为将 2D 图像特征与 3D 场景体素关联,我们引入了高斯衰减深度先验投影(Gaussian-decay Depth-prior Projection, GDP)。该模块沿视线方向将 2D 特征投影至 3D 体素空间中,并以深度先验为中心采用高斯衰减函数。体素语义由 3D U-Net 计算。我们利用传感器运动传播 3D U-Net 的隐状态,并设计了一种新的损失函数以确保时间一致性。我们在 SemanticKITTI 数据集上评估了该方法,并与领先的 SSC 方法进行了比较。SLCF-Net 在所有 SSC 指标上均表现优异,并展现出良好的时间一致性。
引用
@article{arxiv.2403.08885,
title = {SLCF-Net: Sequential LiDAR-Camera Fusion for Semantic Scene Completion using a 3D Recurrent U-Net},
author = {Helin Cao and Sven Behnke},
journal= {arXiv preprint arXiv:2403.08885},
year = {2024}
}
备注
2024 IEEE International Conference on Robotics and Automation (ICRA2024), Yokohama, Japan, May 2024