中文

让你的演员说话:通过动作与外观解耦实现通用且高保真的唇部同步

计算机视觉与模式识别 2024-06-18 v2

摘要

我们旨在根据给定的语音编辑说话视频中的唇部动作,同时保持个人身份和视觉细节。该任务可分为两个子问题:(1)语音驱动的唇部动作生成,(2)视觉外观合成。当前方法在单个生成模型中处理这两个子问题,导致在唇部同步质量与视觉细节保持之间面临困难的权衡。相反,我们提出将动作与外观解耦,分别使用语音到动作扩散模型和动作条件外观生成模型逐一生成。然而,每个阶段仍存在挑战,如(1)中的动作感知身份保持,以及(2)中的视觉细节保持。因此,我们采用关键点表示动作,并进一步采用基于关键点的身份损失以保持个人身份。为捕捉动作无关的视觉细节,我们使用独立的编码器对唇部、非唇部外观和动作进行编码,然后通过学习的融合模块将其整合。我们在大规模且多样化的数据集上训练了 MyTalk。实验表明,我们的方法在双唇同步和视觉细节保持方面对未知乃至外域人物具有良好的泛化能力。我们鼓励读者访问我们的项目页面观看视频(https://Ingrid789.github.io/MyTalk/)。

关键词

引用

@article{arxiv.2406.08096,
  title  = {Make Your Actor Talk: Generalizable and High-Fidelity Lip Sync with Motion and Appearance Disentanglement},
  author = {Runyi Yu and Tianyu He and Ailing Zhang and Yuchi Wang and Junliang Guo and Xu Tan and Chang Liu and Jie Chen and Jiang Bian},
  journal= {arXiv preprint arXiv:2406.08096},
  year   = {2024}
}

备注

14 pages of main text, 23 pages in total, 9 figures