中文

EchoMimic:通过可编辑 landmarks 条件生成以音频为驱动的逼真人物动画

计算机视觉与模式识别 2024-07-15 v2

摘要

人物图像动画领域受音频驱动已取得显著进展,生成逼真且动态的人物形象。传统方法仅利用音频或面部关键点驱动图像生成视频,但仍存在问题。例如,仅依赖音频驱动的方法有时不稳定 due to 相对较弱的音频信号,而仅依赖面部关键点驱动的方法虽然在驱动上更稳定,但会因过度控制关键点信息而导致不自然的结果。为克服上述挑战,本文提出一种新方法,命名为 EchoMimic。EchoMimic 同时使用音频和面部 landmarks 进行训练,能够通过音频和面部 landmarks 单独或两者组合生成人物视频。我们通过全面的比较,在各种公开数据集和收集的数据集上展示了其在定性和定量评估中的优越性能。附加的可视化和源代码可在 EchoMimic 项目页面获取。

关键词

引用

@article{arxiv.2407.08136,
  title  = {EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions},
  author = {Zhiyuan Chen and Jiajiong Cao and Zhiquan Chen and Yuming Li and Chenguang Ma},
  journal= {arXiv preprint arXiv:2407.08136},
  year   = {2024}
}