中文

KeyFace:基于关键帧插值的长时段音频驱动面部动画

计算机视觉与模式识别 2025-03-20 v2 人工智能

摘要

当前音频驱动面部动画方法在短视频上取得令人印象深刻的结果,但在延长到更长时长后会出现误差累积和身份漂移。现有方法通过引入外部空间控制来缓解此问题,虽能提高长期一致性,但牺牲了运动的自然性。我们提出 KeyFace,一个新颖的两阶段扩散框架,以解决上述问题。在第一阶段,基于音频输入和身份帧,在较低的帧率下生成关键帧,以捕捉一段时间内的关键面部表情和运动。在第二阶段,插值模型填补关键帧之间的空隙,确保平滑的过渡和时间连贯性。为进一步提升真实感,我们引入连续情绪表示,并处理广泛的非语音声音(NSV),如笑声和叹气。我们还引入两个新的评估指标,用于评估唇部同步和 NSV 生成。实验结果表明,KeyFace 在生成持续的、自然且连贯的面部动画方面优于当前最先进的方法,成功涵盖了 NSV 和连续情绪。

关键词

引用

@article{arxiv.2503.01715,
  title  = {KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation},
  author = {Antoni Bigata and Michał Stypułkowski and Rodrigo Mira and Stella Bounareli and Konstantinos Vougioukas and Zoe Landgraf and Nikita Drobyshev and Maciej Zieba and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2503.01715},
  year   = {2025}
}

备注

CVPR 2025