中文

扩散头:扩散模型在说话人脸生成上击败 GAN

计算机视觉与模式识别 2023-08-01 v2

摘要

说话人脸生成在历史上一直难以在没有额外参考视频引导的情况下产生头部运动和自然的面部表情。近期基于扩散的生成模型的发展使得数据合成更加真实和稳定,其在图像和视频生成上的性能已超越其他生成模型。在本工作中,我们提出了一种自回归扩散模型,仅需一张身份图像和音频序列即可生成逼真说话人头的视频。我们的方案能够幻觉出头部运动、面部表情(如眨眼),并保留给定背景。我们在两个不同的数据集上评估了我们的模型,在两者上均取得了最先进(state-of-the-art)的结果。

关键词

引用

@article{arxiv.2301.03396,
  title  = {Diffused Heads: Diffusion Models Beat GANs on Talking-Face Generation},
  author = {Michał Stypułkowski and Konstantinos Vougioukas and Sen He and Maciej Zięba and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2301.03396},
  year   = {2023}
}