中文

SVP:风格增强的生动肖像说话头扩散模型

计算机视觉与模式识别 2024-12-02 v2

摘要

说话头生成 (THG) 通常由音频驱动,是一项重要且具有挑战性的任务,在数字人、电影制作和虚拟现实等各个领域具有广阔的应用前景。虽然基于扩散模型的 THG 方法呈现出高质量且稳定的内容生成,但它们往往忽略了内在风格,该风格包含视频的个性化特征,如说话习惯和面部表情。因此,生成的视频内容缺乏多样性和生动性,从而在现实生活场景中受到限制。为了解决这些问题,我们提出了一种名为风格增强生动肖像 (SVP) 的新框架,充分利用 THG 中与风格相关的信息。具体而言,我们首先引入新颖的概率风格先验学习,利用面部表情和音频嵌入将内在风格建模为高斯分布。该分布通过“定制”对比目标进行学习,有效捕捉每个视频中的动态风格信息。然后,我们微调预训练的 Stable Diffusion (SD) 模型,通过交叉注意力将学习到的内在风格作为控制信号注入。实验表明,我们的模型生成了多样、生动且高质量的视频,并能对内在风格进行灵活控制,优于现有的 SOTA 方法。

关键词

引用

@article{arxiv.2409.03270,
  title  = {SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model},
  author = {Weipeng Tan and Chuming Lin and Chengming Xu and Xiaozhong Ji and Junwei Zhu and Chengjie Wang and Yunsheng Wu and Yanwei Fu},
  journal= {arXiv preprint arXiv:2409.03270},
  year   = {2024}
}