中文

4D3R:单目视频中动态场景的运动感知神经重建与渲染

计算机视觉与模式识别 2025-11-10 v1 人工智能

摘要

从单目视频中对动态场景进行新视角合成仍是计算机视觉与图形学中的基础挑战。尽管近期进展如 Neural Radiance Fields (NeRF) 和 3D 高斯溅写 (3DGS) 在静态场景方面取得了有前景的成果,但它们在处理动态内容时仍感困难,通常依赖预计算的相机姿态。我们提出 4D3R,一种无姿态的动态神经渲染框架,通过两阶段方法解耦静态与动态组件。该方法首先利用 3D 基础模型进行初始姿态与几何估计,随后进行运动感知细化。4D3R 引入两项关键技术创新:(1) 一种运动感知束道调整 (MA-BA) 模块,将基于 Transformer 的学习先验与 SAM2 结合,实现对动态物体分割的鲁健化,提升相机姿态细化精度;(2)一种高效的运动感知高斯溅写 (MA-GS) 表示,采用控制点配合变形场 MLP 与线性 blend skinning 来建模动态运动,显著降低计算成本同时保持高质量重建。广泛的真实世界动态数据集实验表明,我们的方法在状态-of-the-art 方法上实现最高 1.8dB PSNR 提升,尤其在大型动态物体等具挑战性场景下表现突出,同时将计算需求降低 5 倍。

关键词

引用

@article{arxiv.2511.05229,
  title  = {4D3R: Motion-Aware Neural Reconstruction and Rendering of Dynamic Scenes from Monocular Videos},
  author = {Mengqi Guo and Bo Xu and Yanyan Li and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2511.05229},
  year   = {2025}
}

备注

17 pages, 5 figures