中文

SyncTalk:说话头合成中同步才是关键

计算机视觉与模式识别 2024-04-30 v2

摘要

在合成逼真的、由语音驱动的说话头视频中实现高同步性是一项重大挑战。传统的生成对抗网络(GAN)难以保持一致的面部身份,而神经辐射场(NeRF)方法虽能解决该问题,却常产生不匹配的唇部运动、不充分的面部表情和不稳定的头部姿态。生动的说话头需要主体身份、唇部运动、面部表情和头部姿态的同步协调。这些同步的缺失是一个根本性缺陷,导致不真实和人工化的结果。为解决被认定为创建逼真说话头中的“魔鬼”的同步关键问题,我们提出 SyncTalk。这种基于 NeRF 的方法有效保持主体身份,增强说话头合成的同步性与真实感。SyncTalk 采用 Face-Sync Controller 将唇部运动与语音对齐,并创新使用 3D 面部 blendshape 模型捕捉准确面部表情。我们的 Head-Sync Stabilizer 优化头部姿态,实现更自然的头部运动。Portrait-Sync Generator 恢复头发细节并将生成头部与躯干融合以获得无缝视觉体验。大量实验和用户研究表明 SyncTalk 在同步性和真实感上优于最先进方法。我们推荐观看补充视频:https://ziqiaopeng.github.io/synctalk

关键词

引用

@article{arxiv.2311.17590,
  title  = {SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis},
  author = {Ziqiao Peng and Wentao Hu and Yue Shi and Xiangyu Zhu and Xiaomei Zhang and Hao Zhao and Jun He and Hongyan Liu and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2311.17590},
  year   = {2024}
}

备注

Accepted by CVPR 2024