中文

SwapTalk:在潜在空间中实现单样本定制的音频驱动说话人脸生成

计算机视觉与模式识别 2024-05-10 v1 人工智能

摘要

将换脸与唇形同步技术相结合,为定制化说话人脸生成提供了一种高性价比的解决方案。然而,直接将现有模型级联往往会引入任务间的显著干扰并降低视频清晰度,因为其交互空间仅限于低层语义 RGB 空间。为了解决这一问题,我们提出了一种创新的统一框架 SwapTalk,其在同一潜在空间中同时完成换脸和唇形同步任务。参考近期关于人脸生成的工作,由于其出色的可编辑性和保真度表现,我们选择了 VQ 嵌入空间。为了增强框架对未见身份的泛化能力,我们在换脸模块训练期间引入了身份损失。此外,在唇形同步模块训练期间,我们在潜在空间内引入专家判别器监督,以提升同步质量。在评估阶段,以往的研究主要关注音视频同步视频中的唇部运动自重构。为了更好地逼近真实应用场景,我们将评估范围扩展至异步音视频场景。此外,我们引入了一种新颖的身份一致性度量,以更全面地评估生成面部视频在时间序列上的身份一致性。在 HDTF 上的实验结果表明,我们的方法在视频质量、唇形同步准确率、换脸保真度以及身份一致性方面均显著超越现有技术。

关键词

引用

@article{arxiv.2405.05636,
  title  = {SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space},
  author = {Zeren Zhang and Haibo Qin and Jiayu Huang and Yixin Li and Hui Lin and Yitao Duan and Jinwen Ma},
  journal= {arXiv preprint arXiv:2405.05636},
  year   = {2024}
}