中文

基于隐式模块化音视觉表示的姿态可控说话人脸生成

计算机视觉与模式识别 2021-04-23 v1 机器学习 多媒体 声音 音频与语音处理 图像与视频处理

摘要

尽管针对任意主体音频驱动说话人脸生成的精确唇形同步已经实现,如何高效驱动头部姿态的问题依然存在。先前方法依赖预估计的结构信息如 landmarks 与 3D 参数,旨在生成个性化的节奏化运动。然而,此类估计信息在极端条件下的不准确性会导致退化问题。本文中,我们提出一个简洁而有效的框架以生成姿态可控说话人脸。我们基于原始人脸图像操作,仅使用单张照片作为身份参考。关键是通过设计隐式低维姿态编码将音视觉表示模块化。实质上,语音内容与头部姿态信息均位于一个联合的非身份嵌入空间中。虽然语音内容信息可通过学习音视觉模态间的内在同步来定义,但我们确认姿态编码将在基于调制卷积的重建框架中被互补地学习。大量实验表明,我们的方法生成了唇形精确同步且姿态可由其他视频控制的说话人脸。此外,我们的模型具备多种高级能力,包括极端视角鲁棒性与说话人脸正面化。代码、模型与演示视频可见于 https://hangz-nju-cuhk.github.io/projects/PC-AVS。

关键词

引用

@article{arxiv.2104.11116,
  title  = {Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual Representation},
  author = {Hang Zhou and Yasheng Sun and Wayne Wu and Chen Change Loy and Xiaogang Wang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2104.11116},
  year   = {2021}
}

备注

Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021. Code and models are available at https://github.com/Hangz-nju-cuhk/Talking-Face_PC-AVS