中文

Diff2Lip:用于唇形同步的音频条件扩散模型

计算机视觉与模式识别 2023-08-21 v1 人工智能

摘要

唇形同步(lip-sync)任务旨在将人脸的嘴唇与不同音频相匹配。它在电影行业以及创建虚拟化身和视频会议中具有多种应用。这是一个具有挑战性的问题,因为需要同时引入细致、真实的唇部运动,同时保留身份、姿态、情感和图像质量。许多先前尝试解决该问题的方法由于缺少完整的上下文信息而遭受图像质量退化。本文中,我们提出 Diff2Lip,一种音频条件的基于扩散的模型,能够在自然场景下(in-the-wild)进行唇形同步,同时保留这些特性。我们在 Voxceleb2(一个包含自然场景说话人脸视频的视频数据集)上训练我们的模型。大量研究表明,我们的方法在 Fréchet inception distance(FID)指标和用户平均意见得分(MOS)上优于 Wav2Lip 和 PC-AVS 等流行方法。我们在 Voxceleb2 和 LRW 数据集上展示了重建(相同音视频输入)以及交叉(不同音视频输入)设置下的结果。视频结果和代码可从我们的项目页面(https://soumik-kanad.github.io/diff2lip)获取。

关键词

引用

@article{arxiv.2308.09716,
  title  = {Diff2Lip: Audio Conditioned Diffusion Models for Lip-Synchronization},
  author = {Soumik Mukhopadhyay and Saksham Suri and Ravi Teja Gadde and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2308.09716},
  year   = {2023}
}

备注

Website: see https://soumik-kanad.github.io/diff2lip . Submission under review