中文

SyncTalkFace:基于音频-唇部记忆实现精确唇形同步的说话人脸生成

计算机视觉与模式识别 2022-11-04 v2 人工智能 图像与视频处理

摘要

从语音生成说话人脸的挑战在于对齐音频和视频两种不同模态信息,使嘴部区域与输入音频对应。先前方法要么利用音视频表示学习,要么借助 landmark 和 3D 模型等中间结构信息。然而,它们难以合成音素级变化的唇部精细细节,因为在视频合成步骤中未充分提供唇部的视觉信息。为克服该限制,本工作提出音频-唇部记忆(Audio-Lip Memory),其引入与输入音频对应的嘴部区域视觉信息并强制细粒度音视频一致性。它将顺序真实图像的唇部运动特征存储在值记忆中,并与相应音频特征对齐,以便在推理时可使用音频输入检索它们。因此,利用检索到的唇部运动特征作为视觉提示,可在合成步骤中轻松关联音频与视觉动态。通过分析记忆,我们证明每个记忆槽在音素级存储了独特唇部特征,基于记忆寻址捕捉细微唇部运动。此外,我们引入视觉-视觉同步损失,当与音视频同步损失一同用于我们的模型时可增强唇形同步性能。大量实验验证我们的方法生成高质量视频,其嘴形与输入音频最佳对齐,优于先前最先进方法。

关键词

引用

@article{arxiv.2211.00924,
  title  = {SyncTalkFace: Talking Face Generation with Precise Lip-Syncing via Audio-Lip Memory},
  author = {Se Jin Park and Minsu Kim and Joanna Hong and Jeongsoo Choi and Yong Man Ro},
  journal= {arXiv preprint arXiv:2211.00924},
  year   = {2022}
}

备注

Accepted at AAAI 2022 (Oral)