中文

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

计算机视觉与模式识别 2026-01-19 v3

摘要

隐式神经表示在多种场景的三维重建中展现了有前景的结果。然而,现有方法要么难以建模快速移动的物体,要么无法处理城市环境中大规模的相机自身运动。这导致大规模城市场景的合成视图质量低下。在本文中,我们旨在联合解决由大规模场景和快速移动车辆引起的问题,这些问题更加实际且具有挑战性。为此,我们提出了一种渐进式场景图网络架构,用于学习动态物体的局部场景表示和全局城市场景。渐进式学习架构动态分配一个新的局部场景图,该图在时间窗口内的帧上训练,窗口大小自动确定,使我们能够将表示扩展到任意大的场景。此外,根据我们的观察,由于快速运动,动态物体的训练视图相对稀疏,这导致动态物体的重建精度显著下降。因此,我们利用一个基础模型网络来编码潜在码。具体来说,我们利用视觉基础模型 DINOv2 的泛化能力来提取外观和形状码,并在大规模城市场景物体数据集上训练网络,以增强其处理稀疏视图动态输入的先验建模能力。同时,我们引入了一个频率调制模块,该模块对物体的频谱进行正则化,从而从频域角度解决稀疏图像输入建模的挑战。实验结果表明,我们的方法在各种场景中实现了最先进的视图合成精度、物体操作和场景漫游能力。

关键词

引用

@article{arxiv.2312.09076,
  title  = {ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes},
  author = {Tianchen Deng and Yanbo Wang and Yejia Liu and Chenpeng Su and Jingchuan Wang and Danwei Wang and Shao-Yuan Lo and Weidong Chen},
  journal= {arXiv preprint arXiv:2312.09076},
  year   = {2026}
}