中文

SPACE:基于语音驱动且可控制表情的人像动画生成

计算机视觉与模式识别 2022-12-08 v2

摘要

近年来,利用语音驱动人像动画受到了越来越多的关注,并拥有多种创意和实用场景。理想的生成视频应具备与音频良好的唇形同步、自然的面部表情与头部运动,以及高帧质量。本文提出 SPACE,它使用语音和单张图像生成高分辨率、富有表现力的视频,具有逼真的头部姿态,且无需驱动视频。它采用多阶段方法,将面部 landmark 的可控性与预训练人脸生成器的高质量合成能力相结合。SPACE 还允许控制情绪及其强度。我们的方法在图像质量和面部运动的客观指标上优于先前方法,并在成对比较中受到用户的强烈偏好。项目网站位于 https://deepimagination.cc/SPACE/。

关键词

引用

@article{arxiv.2211.09809,
  title  = {SPACE: Speech-driven Portrait Animation with Controllable Expression},
  author = {Siddharth Gururani and Arun Mallya and Ting-Chun Wang and Rafael Valle and Ming-Yu Liu},
  journal= {arXiv preprint arXiv:2211.09809},
  year   = {2022}
}