GUSH3R:将单目视频中的动态人物与场景统一重建为高斯表示
计算机视觉与模式识别
2026-07-06 v1
摘要
从单目视频重建动态人物-场景环境是一个具有挑战性的问题,需要联合建模场景几何、相机运动和非刚性人体动力学,同时实现照片级逼真渲染。最近的前馈方法可以高效地预测几何,但它们通常局限于非照片级逼真的表示,如点云和网格,或者无法处理非刚性物体,尤其是动态人物。为了填补这一空白,我们提出了 GUSH3R(Gaussian-Unified Scene Human 3D Reconstruction),一个用于在线动态人物-场景重建的前馈框架。从单目人物-场景视频中,我们的方法在一次前向传播中(all at once)将动态人物(everyone)和静态场景(everywhere)重建为 3D 高斯泼溅(3DGS)基元(as gaussians),这些基元在几何上一致,并且能够进行新视角合成。在单目人物-场景数据集上的实验表明,与基于优化的方法相比,我们的方法在实现有竞争力的新视角合成质量的同时,显著提高了推理效率。
引用
@article{arxiv.2607.05243,
title = {GUSH3R: Everyone Everywhere All at Once as Gaussians},
author = {Keito Abe and Kaede Shiohara and Takashi Otonari and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2607.05243},
year = {2026}
}
备注
Project page: https://abkeito.github.io/gush3r-page/