中文

VOODOO 3D:用于单样本三维头部重演的体积肖像解耦

计算机视觉与模式识别 2023-12-11 v1

摘要

我们提出一种基于全体积神经解耦框架的三维感知单样本头部重演方法,用于分离源外观和驱动表情。我们的方法是实时的,能生成高保真且视角一致的输出,适用于基于全息显示的三维电话会议系统。现有尖端的三维感知重演方法常使用神经辐射场或三维网格来生成视角一致的外观编码,但同时依赖线性人脸模型(如3DMM)来实现其与面部表情的解耦。因此,它们的重演结果常出现驱动者的身份泄露或表情不自然的问题。为解决这些问题,我们提出一种神经自监督解耦方法,将源图像和驱动视频帧都提升到基于三平面的共享三维体积表示中。然后,可以使用从驱动图像中提取的表情三平面自由操控该表示,并利用神经辐射场从任意视角进行渲染。我们通过在大型自然场景视频数据集上进行自监督学习来实现这种解耦。我们进一步引入一种高效的微调方法,利用相同的真实世界数据来提升三维提升的泛化能力。我们在广泛的数据集上展示了最先进的性能,并在极具挑战性和多样化的对象上展示了高质量的三维感知头部重演,包括源对象和驱动对象的非正面头部姿态和复杂表情。

关键词

引用

@article{arxiv.2312.04651,
  title  = {VOODOO 3D: Volumetric Portrait Disentanglement for One-Shot 3D Head Reenactment},
  author = {Phong Tran and Egor Zakharov and Long-Nhat Ho and Anh Tuan Tran and Liwen Hu and Hao Li},
  journal= {arXiv preprint arXiv:2312.04651},
  year   = {2023}
}