中文

高保真且自由可控的说话人头视频生成

计算机视觉与模式识别 2023-11-03 v2

摘要

说话人头生成是指基于给定的源身份和目标运动生成视频。然而,现有方法面临若干限制生成视频质量与可控性的挑战。首先,生成的人脸常出现非预期形变与严重扭曲。其次,驱动图像未显式解耦与运动相关的信息(如姿态与表情),限制了生成过程中对不同属性的操控。第三,由于相邻帧间提取的人脸关键点不一致,生成视频往往出现闪烁伪影。本文提出一种新颖模型,可生成高保真说话人头视频,并自由控制头部姿态与表情。我们的方法同时利用自监督学习的关键点与基于 3D 人脸模型的关键点来建模运动。我们还引入一种新颖的运动感知多尺度特征对齐模块,以在无人脸扭曲的情况下有效迁移运动。此外,我们通过特征上下文适配与传播模块增强了合成说话人头视频的平滑性。我们在具有挑战性的数据集上评估了我们的模型,并展示了其最先进的性能。

关键词

引用

@article{arxiv.2304.10168,
  title  = {High-Fidelity and Freely Controllable Talking Head Video Generation},
  author = {Yue Gao and Yuan Zhou and Jinglu Wang and Xiao Li and Xiang Ming and Yan Lu},
  journal= {arXiv preprint arXiv:2304.10168},
  year   = {2023}
}

备注

CVPR 2023