4DGT:基于 4D 高斯变换器的单目实景视频学习
计算机视觉与模式识别
2025-12-02 v2
摘要
我们提出了 4DGT,这是一个基于 4D 高斯的变换器模型,用于动态场景重建,完全基于真实世界的单目带姿态视频进行训练。运用 4D 高斯作为归纳偏置,4DGT 统一了静态和动态成分,能够建模具有不同对象寿命的复杂、随时间变化的环境。我们提出了一种新颖的密度控制策略,用于训练,该策略使我们的 4DGT 能够处理更长的时空输入,同时在运行时保持高效渲染。我们的模型以滚动窗口方式处理 64 个连续的带姿态帧,预测场景中一致的 4D 高斯。不同于优化导师方法,4DGT 进行纯前向推理,将重建时间从数小时缩短到数秒,并能有效扩展到长视频序列。仅在大规模单目带姿态视频数据集上训练,4DGT 在真实世界视频中显著优于先前的高斯基网络,并在跨域视频上实现与优化导师方法持平的准确度。项目页面:https://4dgt.github.io
引用
@article{arxiv.2506.08015,
title = {4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos},
author = {Zhen Xu and Zhengqin Li and Zhao Dong and Xiaowei Zhou and Richard Newcombe and Zhaoyang Lv},
journal= {arXiv preprint arXiv:2506.08015},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight); Project Page: https://4dgt.github.io