中文

HyperLips:基于超网络控制嘴唇与高分辨率解码器的高保真说话人脸生成

计算机视觉与模式识别 2023-10-17 v3

摘要

说话人脸生成在虚拟数字人领域具有广泛的潜在应用。然而,在确保唇形同步的同时渲染高保真人脸视频,对于现有音频驱动的说话人脸生成方法仍是一项挑战。为解决此问题,我们提出 HyperLips,一种由用于控制嘴唇的超网络与用于渲染高保真人脸的高分辨率解码器组成的两阶段框架。在第一阶段,我们构建基础人脸生成网络,利用超网络根据音频控制视觉人脸信息的编码潜码。首先,FaceEncoder 通过从含人脸帧的视频源中提取视觉人脸信息特征来获得潜码。随后,以音频特征为输入、由 HyperNet 更新权重的 HyperConv 将修改潜码,以使嘴唇运动与音频同步。最后,FaceDecoder 将修改后的同步潜码解码为视觉人脸内容。在第二阶段,我们通过高分辨率解码器获得更高质量的人脸视频。为进一步提升人脸生成质量,我们训练了高分辨率解码器 HRDecoder,以第一阶段生成的人脸图像与检测到的草图作为输入。大量定量与定性实验表明,我们的方法在更真实、高保真及唇形同步方面优于当前最优(SOTA)工作。项目页面:https://semchan.github.io/HyperLips Project/

关键词

引用

@article{arxiv.2310.05720,
  title  = {HyperLips: Hyper Control Lips with High Resolution Decoder for Talking Face Generation},
  author = {Yaosen Chen and Yu Yao and Zhiqiang Li and Wei Wang and Yanru Zhang and Han Yang and Xuming Wen},
  journal= {arXiv preprint arXiv:2310.05720},
  year   = {2023}
}