面向自动驾驶的自监督多模态 NeRF
计算机视觉与模式识别
2025-06-26 v2
摘要
本文提出一种基于神经光度场(NeRF)的框架,称为 Novel View Synthesis Framework(NVSF)。该框架联合学习空间和时间变化场景的隐式神经表示,同时支持 LiDAR 和摄像头数据。我们在包含静态与动态场景的真实自动驾驶场景中进行测试。与现有多模态动态 NeRF 相比,我们的框架采用自监督方式,无需 3D 标注。为实现高效训练和更快收敛,我们引入基于启发式的图像像素采样,以聚焦于信息丰富的像素。为保留 LiDAR 点的局部特征,采用双梯度基于掩码的方法。 extensive 实验在 KITTI-360 数据集上表明,与基线模型相比,我们的框架在 LiDAR 和摄像头两个领域均取得了最佳性能。该模型的代码已公开于 https://github.com/gaurav00700/Selfsupervised-NVSF。
引用
@article{arxiv.2506.19615,
title = {Self-Supervised Multimodal NeRF for Autonomous Driving},
author = {Gaurav Sharma and Ravi Kothari and Josef Schmid},
journal= {arXiv preprint arXiv:2506.19615},
year = {2025}
}