Forge4D:从未校准的稀疏视角视频中进行面向4D的人类重建与插值
计算机视觉与模式识别
2025-09-30 v1
摘要
从未校准的稀疏视角视频中即时重建动态3D人类的能力对于诸多下游应用至关重要。然而,现有方法要么受限于重建速度慢,要么无法生成新时间尺度的表示。为此,我们提出Forge4D,一种面向4D的人类重建与插值的前馈模型,能够高效地从未校准的稀疏视角视频中重建时间对齐的表示,实现新的视角和新时间的合成。我们的模型将4D重建与插值问题简化为流式3D高斯重建和稠密运动预测的联合任务。对于流式3D高斯重建任务,我们首先从未校准的稀疏视角图像中重建静态3D高斯,然后引入可学习的状态记号,通过在不同时间戳之间交互式更新共享信息,以内存友好方式实现时间一致性。对于新时间合成,我们设计了新的运动预测模块,用于预测两个相邻帧之间每个3D高斯的稠密运动,并配合基于遮挡的高斯融合过程,对任意时间戳的3D高斯进行插值。为克服密集运动监督缺乏真实标注的困难,我们将密集运动预测建模为密集点匹配任务,并引入自监督的re-targeting损失以优化该模块。此外,还引入基于遮挡的光流损失,以确保运动与合理人类运动的一致性,提供更强的正则化。大量实验表明,我们的方法在面向和非面向的数据集上均表现出色。项目页面和代码:https://zhenliuzju.github.io/huyingdong/Forge4D。
引用
@article{arxiv.2509.24209,
title = {Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos},
author = {Yingdong Hu and Yisheng He and Jinnan Chen and Weihao Yuan and Kejie Qiu and Zehong Lin and Siyu Zhu and Zilong Dong and Jun Zhang},
journal= {arXiv preprint arXiv:2509.24209},
year = {2025}
}