That's What I Said:完全可控的说话人脸生成
计算机视觉与模式识别
2023-09-19 v2
摘要
本文的目标是合成具有可控面部动作的说话人脸。为实现这一目标,我们提出了两个关键想法。首先是建立一个规范空间,其中每张人脸具有相同的运动模式但身份不同。其次是导航一个多模态运动空间,该空间仅表示与运动相关的特征,同时消除身份信息。为了解耦身份和运动,我们在两个不同的潜在空间之间引入了正交约束。由此,我们的方法能够生成具有完全可控面部属性和准确唇部同步的自然逼真的说话人脸。大量实验表明,我们的方法在视觉质量和唇部同步评分方面均达到了 SOTA 结果。据我们所知,我们是首个开发出说话人脸生成框架的,该框架能够在生成的视频中准确体现包括唇部、头部姿态和眼部运动在内的完整目标面部运动,且无需任何超出带音频的 RGB 视频的额外监督。
引用
@article{arxiv.2304.03275,
title = {That's What I Said: Fully-Controllable Talking Face Generation},
author = {Youngjoon Jang and Kyeongha Rho and Jong-Bin Woo and Hyeongkeun Lee and Jihwan Park and Youshin Lim and Byeong-Yeol Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2304.03275},
year = {2023}
}