Neural-MMGS:基于多模态神经高斯斯plat的大规模场景重建
计算机视觉与模式识别
2025-09-23 v1
摘要
本文提出 Neural-MMGS,一种用于多模态大规模场景重建的新型神经 3DGS 框架,通过在每个高斯斯plat中融合多种感知模态的紧凑、可学习的嵌入。虽然近期聚焦大规模场景重建的研究已采纳 LiDAR 数据以提供更精确的几何约束,但我们认为 LiDAR 丰富的物理属性仍未得到充分探索。类似地,语义信息虽用于物体检索,却可为场景重建提供有价值的高层次上下文。传统方法将这些属性作为独立参数附加至高斯斯plat,增加内存占用并限制跨模态的信息交互。相反,我们的方法将图像、LiDAR 与语义等所有模态融合至紧凑的可学习嵌入中,隐式地在每个高斯斯plat中编码光学、物理与语义特征。随后我们训练轻量级神经解码器,将这些嵌入映射至高斯斯plat 参数,实现对各感知模态的重建,同时降低内存开销并提升可扩展性。在 Oxford Spires 与 KITTI-360 数据集上进行评估,我们在 Oxford Spires 上实现更高质量的重建,在 KITTI-360 上以更低的存储消耗实现与当前方法在 LiDAR 基于新视角合成中相当的性能。
关键词
引用
@article{arxiv.2509.17762,
title = {Neural-MMGS: Multi-modal Neural Gaussian Splats for Large-Scale Scene Reconstruction},
author = {Sitian Shen and Georgi Pramatarov and Yifu Tao and Daniele De Martini},
journal= {arXiv preprint arXiv:2509.17762},
year = {2025}
}