中文

用于动态场景 3D 表示的预测

计算机视觉与模式识别 2025-01-29 v1

摘要

我们提出了一种新的框架,用于从单目视频流预测动态辐射场。不同于以往仅聚焦于预测未来帧的方法,本方法进一步生成动态场景的显式 3D 表示。该框架基于两个核心设计。其一,采用 ego-centric 无界 triplane 以显式表示动态物理世界。其二,开发了一种 4D-aware transformer 来聚合单目视频特征以更新 triplane。将这两个设计耦合在一起,我们能够以自监督方式在大规模单目视频上训练所提出的模型。我们的模型在 NVIDIA 动态场景上实现了动态辐射场预测的最佳结果,展示了其在 4D 物理世界建模方面的强大性能。此外,我们的模型对未见情景表现出优异的泛化能力。值得注意的是,我们发现该方法展现了几何和语义学习的能力。

关键词

引用

@article{arxiv.2501.16617,
  title  = {Predicting 3D representations for Dynamic Scenes},
  author = {Di Qi and Tong Yang and Beining Wang and Xiangyu Zhang and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2501.16617},
  year   = {2025}
}