通过隐式面部关键点编辑实现可控说话人脸生成
计算机视觉与模式识别
2024-11-08 v2 人工智能
摘要
音频驱动的说话人脸生成在数字人研究领域引起了广泛兴趣。现有方法受限于复杂的模型架构,这些架构相互依赖,使得重新编辑图像或视频输入的过程复杂化。在这项工作中,我们提出了ControlTalk,一种基于驱动音频控制面部表情变形的说话人脸生成方法,能够以统一的方式为单张图像或连续视频输入构建头部姿态和面部表情(包括嘴唇运动)。通过利用预训练的视频合成渲染器并提出轻量级适配,ControlTalk实现了精确且自然的唇形同步,同时能够对嘴巴张开形状进行定量控制。我们的实验表明,该方法在广泛使用的基准(包括HDTF和MEAD)上优于现有最先进性能。参数化适配展示了显著的泛化能力,能够有效处理同ID和跨ID场景下的表情变形,并将其效用扩展到域外人像,无论语言如何。代码可在https://github.com/NetEase-Media/ControlTalk获取。
引用
@article{arxiv.2406.02880,
title = {Controllable Talking Face Generation by Implicit Facial Keypoints Editing},
author = {Dong Zhao and Jiaying Shi and Wenjun Li and Shudong Wang and Shenghui Xu and Zhaoming Pan},
journal= {arXiv preprint arXiv:2406.02880},
year = {2024}
}