中文

HumanGif:基于生成式先验的单视图人类扩散

计算机视觉与模式识别 2025-07-01 v3

摘要

先前的 3D 人类创建方法在从稀疏视图图像或单目视频合成视角一致且时序对齐的结果方面取得了显著进展。然而,在单视图输入setting 下,仍然具有生成持续真实、视角一致且时序连贯的人类头像的挑战,因为单视图输入信息有限。鼓舞于 2D 角色动画的成功,我们提出了 HumanGif,一款基于生成式先验的单视图人类扩散模型。具体而言,我们将单视图驱动的 3D 人类新视角和姿态合成表述为单视图条件下的人类扩散过程,利用来自基础扩散模型的生成式先验来补充缺失信息。为确保新视角和姿态合成细粒度且一致,我们在 HumanGif 中引入 Human NeRF 模块,从输入图像中学习空间对齐特征,隐式地捕获相对相机和人类姿态变换。此外,我们在优化过程中引入图像级损失,以弥合潜在空间与图像空间之间的差距。广泛的实验在 RenderPeople、DNA-Rendering、THuman 2.1 和 TikTok 数据集上表明,HumanGif 在感知性能上达到最佳,同时在新视角和姿态合成方面表现出更好的通用性。

关键词

引用

@article{arxiv.2502.12080,
  title  = {HumanGif: Single-View Human Diffusion with Generative Prior},
  author = {Shoukang Hu and Takuya Narihira and Kazumi Fukuda and Ryosuke Sawata and Takashi Shibuya and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2502.12080},
  year   = {2025}
}

备注

Project page: https://skhu101.github.io/HumanGif/