中文

用于音频驱动面部重演的参数化隐式人脸表示

计算机视觉与模式识别 2023-06-14 v1

摘要

音频驱动面部重演是一项关键技术,在电影制作、虚拟化身和视频会议中具有一系列应用。现有工作要么采用显式中间人脸表示(如 2D 面部标志点或 3D 人脸模型),要么采用隐式表示(如神经辐射场),因而在可解释性与表达能力之间,进而在结果的可控性与质量之间面临权衡。本工作中,我们用新颖的参数化隐式人脸表示打破了这些权衡,并提出了一种既可控又能生成高质量说话头的新型音频驱动面部重演框架。具体而言,我们的参数化隐式表示用可解释的 3D 人脸模型参数对隐式表示进行参数化,从而兼取显式与隐式方法之长。此外,我们提出若干新技术以改进框架的三个组件,包括 i) 将上下文信息纳入音频到表情参数编码;ii) 使用条件图像合成对隐式表示进行参数化,并以创新的三平面结构实现以高效学习;iii) 将面部重演表述为条件图像修复问题,并提出一种新颖的数据增强技术以提升模型泛化性。大量实验表明,我们的方法能生成比先前方法更逼真的结果,且更忠实于说话人的身份与说话风格。

关键词

引用

@article{arxiv.2306.07579,
  title  = {Parametric Implicit Face Representation for Audio-Driven Facial Reenactment},
  author = {Ricong Huang and Peiwen Lai and Yipeng Qin and Guanbin Li},
  journal= {arXiv preprint arXiv:2306.07579},
  year   = {2023}
}

备注

CVPR 2023