中文

MODA:基于双注意力一次性映射的音频驱动人像动画

计算机视觉与模式识别 2023-07-20 v1

摘要

音频驱动人像动画旨在合成由给定音频所条件化的肖像视频。动画化高保真且多模态的视频肖像具有多种应用。先前的方法试图通过训练不同模型或从给定视频中采样信号来捕捉不同运动模式并生成高保真肖像视频。然而,缺乏唇形同步与其他运动(如头部姿态/眨眼)之间的关联学习通常导致不自然的结果。在本文中,我们提出一个用于多人、多样且高保真说话人像生成的统一系统。我们的方法包含三个阶段,即 1)具有双注意力的一次性映射网络(MODA)从给定音频生成说话表征。在 MODA 中,我们设计双注意力模块以编码准确的嘴部运动与多样模态。2)面部合成网络生成密集且细致的面部关键点,以及 3)时间引导渲染器合成稳定视频。大量评估表明,与先前方法相比,所提系统生成更自然且真实的视频肖像。

关键词

引用

@article{arxiv.2307.10008,
  title  = {MODA: Mapping-Once Audio-driven Portrait Animation with Dual Attentions},
  author = {Yunfei Liu and Lijian Lin and Fei Yu and Changyin Zhou and Yu Li},
  journal= {arXiv preprint arXiv:2307.10008},
  year   = {2023}
}

备注

Accepted by ICCV 2023