中文

MOGS:大场景中单目物体引导的高斯泼溅

计算机视觉与模式识别 2026-02-24 v4

摘要

3D高斯泼溅(3DGS)的最新进展带来了惊人的照片级真实感,将其扩展至大场景为自动驾驶等应用中的语义推理与预测开辟了新机遇。当今的大场景最先进系统主要源于利用远程深度感知的LiDAR流水线。然而,它们需要昂贵的高通道传感器,其密集点云加重了内存与计算负担,限制了可扩展性、车队部署及优化速度。我们提出MOGS,一种单目3DGS框架,用源自稀疏视觉惯性(VI)运动恢复结构(SfM)线索的物体锚定、度量化的稠密深度替代主动LiDAR深度。我们的核心思想是利用图像语义假设逐物体形状先验,用稀疏但度量可靠的SfM点对其进行锚定,并将所得度量约束在各物体内传播以生成稠密深度。针对两个关键挑战,即物体内SfM覆盖不足与跨物体几何不一致,MOGS引入(1)多尺度形状一致性模块,自适应地将小片段合并为SfM支持最佳的粗糙物体,并用参数化形状模型对其进行拟合;以及(2)跨物体深度优化模块,在结合几何一致性、先验锚定与边缘感知平滑度的组合目标下优化逐像素深度。在公开数据集上的实验表明,借助低成本的VI传感器套件,MOGS将训练时间最多减少30.4%,内存消耗降低19.8%,同时在大场景中实现了与昂贵LiDAR方法相媲美的高质量渲染。

关键词

引用

@article{arxiv.2509.06685,
  title  = {MOGS: Monocular Object-guided Gaussian Splatting in Large Scenes},
  author = {Shengkai Zhang and Yuhe Liu and Jianhua He and Xuedou Xiao and Mozi Chen and Kezhong Liu},
  journal= {arXiv preprint arXiv:2509.06685},
  year   = {2026}
}