中文

GAF:基于多视角扩散的单目视频高斯头像重建

计算机视觉与模式识别 2025-04-15 v2 人工智能 图形学

摘要

我们提出了一种新颖的方法,用于从由手机等便携设备拍摄的单目视频中重建可动画化的3D高斯头像。由于观察有限,仅用单目录像重建逼真的3D头部头像具有挑战性,这会导致未观察区域受约束不足,进而在新视角下产生瑕疵。为解决此问题,我们引入多视角头部扩散模型,利用其先验知识填充缺失区域,确保高斯溅写渲染的视角一致性。为实现精确的视点控制,我们使用从FLAME-based头部重建渲染的法线图,提供像素级的归纳偏置。我们还将扩散模型条件化于从输入图像中提取的VAE特征,以保留面部身份和外观细节。对于高斯头像重建,我们通过使用迭代去噪图像作为伪真值来蒸馏多视角扩散先验,有效缓解了过度饱和问题。为进一步提升逼真度,我们应用潜空间上采样先验,在解码为图像之前细化去噪后的潜空间。我们在NeRSemble数据集上进行评估,表明GAF在新视角合成方面优于以往最先进的方法。此外,我们展示了从手机等便携设备拍摄的单目视频中获得更高保真度的头像重建。

关键词

引用

@article{arxiv.2412.10209,
  title  = {GAF: Gaussian Avatar Reconstruction from Monocular Videos via Multi-view Diffusion},
  author = {Jiapeng Tang and Davide Davoli and Tobias Kirschstein and Liam Schoneveld and Matthias Niessner},
  journal= {arXiv preprint arXiv:2412.10209},
  year   = {2025}
}

备注

Paper Video: https://youtu.be/QuIYTljvhyg Project Page: https://tangjiapeng.github.io/projects/GAF