SVP:风格增强的生动肖像说话头扩散模型
计算机视觉与模式识别
2024-12-02 v2
摘要
说话头生成 (THG) 通常由音频驱动,是一项重要且具有挑战性的任务,在数字人、电影制作和虚拟现实等各个领域具有广阔的应用前景。虽然基于扩散模型的 THG 方法呈现出高质量且稳定的内容生成,但它们往往忽略了内在风格,该风格包含视频的个性化特征,如说话习惯和面部表情。因此,生成的视频内容缺乏多样性和生动性,从而在现实生活场景中受到限制。为了解决这些问题,我们提出了一种名为风格增强生动肖像 (SVP) 的新框架,充分利用 THG 中与风格相关的信息。具体而言,我们首先引入新颖的概率风格先验学习,利用面部表情和音频嵌入将内在风格建模为高斯分布。该分布通过“定制”对比目标进行学习,有效捕捉每个视频中的动态风格信息。然后,我们微调预训练的 Stable Diffusion (SD) 模型,通过交叉注意力将学习到的内在风格作为控制信号注入。实验表明,我们的模型生成了多样、生动且高质量的视频,并能对内在风格进行灵活控制,优于现有的 SOTA 方法。
引用
@article{arxiv.2409.03270,
title = {SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model},
author = {Weipeng Tan and Chuming Lin and Chengming Xu and Xiaozhong Ji and Junwei Zhu and Chengjie Wang and Yunsheng Wu and Yanwei Fu},
journal= {arXiv preprint arXiv:2409.03270},
year = {2024}
}