GFlow:从单目视频恢复4D 世界
计算机视觉与模式识别
2025-01-03 v2 人工智能
摘要
从单目视频恢复4D 世界是一个至关重要却又充满挑战的任务。常规方法通常依赖于多视角视频、已知相机参数或静态场景的假设。在本文中,我们放宽了所有这些限制, Tackle 一个高度 ambitious 却又实用的任务:仅凭一段无相机参数的单目视频,我们旨在恢复动态3D 世界并估计相机位姿。为此,我们引入了 GFlow,一个仅利用2D 先验(深度和光流)将视频提升到4D 场景的框架, 作为3D 高斯在空间和时间中的流动。GFlow 通过将视频分割为静止和运动部分,然后在优化相机位姿和3D 高斯点的动态之间交替进行来实现。该方法确保相邻点的一致性,并在帧之间实现平滑过渡。由于动态场景始终会持续引入新的视觉内容,我们提出了先验驱动的初始化策略和基于像素的密集化技术,用于整合新的内容。通过结合所有这些技术,GFlow 超越了从因果视频恢复4D 场景的边界;它自然实现了点的跟踪和跨帧的运动物体分割。此外,GFlow 为每一帧估计相机位姿,使 novel view synthesis 能够通过改变相机位姿来实现。这一功能促进了大量场景级或对象级编辑,凸显了 GFlow 的多功能性和有效性。项目主页:https://littlepure2333.github.io/GFlow
引用
@article{arxiv.2405.18426,
title = {GFlow: Recovering 4D World from Monocular Video},
author = {Shizun Wang and Xingyi Yang and Qiuhong Shen and Zhenxiang Jiang and Xinchao Wang},
journal= {arXiv preprint arXiv:2405.18426},
year = {2025}
}
备注
AAAI 2025. Project page: https://littlepure2333.github.io/GFlow