Diffuman4D: 基于时空扩散模型的稀疏视角人类视图合成
计算机视觉与模式识别
2025-07-18 v1
摘要
本文旨在解决稀疏视角人类视图合成的高保真挑战。先前方法通过利用 4D 扩散模型在新视角生成视频来解决观察不足的问题。然而,这些模型生成的视频往往缺乏时空一致性,从而影响视图合成质量。本文提出了一种新的滑动迭代去噪过程,以增强 4D 扩散模型的时空一致性。具体而言,我们定义一个潜在网格,其中每个潜在变量编码了特定视角和时间戳的图像、相机姿态和人体姿态。然后,我们沿着空间和时间维度使用滑动窗口交替去噪该潜在网格,最后从相应的去噪潜在变量中解码目标视角的视频。通过迭代滑动,信息在潜在网格之间充分流动,使扩散模型能够获得较大的感受野,从而增强输出的 4D 一致性,同时使 GPU 内存消耗保持可接受。在 DNA-Rendering 和 ActorsHQ 数据集上的实验表明,我们的方法能够合成高质量且一致的新视角视频,并显著优于现有方法。详见我们的项目页面获取交互演示和视频结果: https://diffuman4d.github.io/。
引用
@article{arxiv.2507.13344,
title = {Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models},
author = {Yudong Jin and Sida Peng and Xuan Wang and Tao Xie and Zhen Xu and Yifan Yang and Yujun Shen and Hujun Bao and Xiaowei Zhou},
journal= {arXiv preprint arXiv:2507.13344},
year = {2025}
}
备注
Project page: https://diffuman4d.github.io/