DREAM-Talk:基于扩散模型的逼真情感音频驱动的单图像说话人脸生成方法
计算机视觉与模式识别
2023-12-22 v1
摘要
从单张人像图像生成情感说话人脸仍是一项重大挑战。同时实现富有表现力的情感说话与精确的唇形同步尤为困难,因为表现力往往会为了唇形同步的准确性而受损。正如许多先前工作广泛采用的那样,LSTM网络通常无法捕捉情感表情的微妙之处与变化。为了应对这些挑战,我们引入了DREAM-Talk,这是一个两阶段的基于扩散模型的音频驱动框架,专为同时生成多样化表情和精确唇形同步而设计。在第一阶段,我们提出了EmoDiff,一个新颖的扩散模块,它根据音频和参考情感风格生成多样且高度动态的情感表情与头部姿态。鉴于唇部运动与音频之间的强相关性,我们随后利用音频特征和情感风格对动态进行细化,以增强唇形同步的准确性。为此,我们部署了视频到视频的渲染模块,将表情和唇部运动从我们的代理3D avatar转移到任意人像上。在定量和定性方面,DREAM-Talk在表现力、唇形同步准确性和感知质量上均优于state-of-the-art方法。
引用
@article{arxiv.2312.13578,
title = {DREAM-Talk: Diffusion-based Realistic Emotional Audio-driven Method for Single Image Talking Face Generation},
author = {Chenxu Zhang and Chao Wang and Jianfeng Zhang and Hongyi Xu and Guoxian Song and You Xie and Linjie Luo and Yapeng Tian and Xiaohu Guo and Jiashi Feng},
journal= {arXiv preprint arXiv:2312.13578},
year = {2023}
}
备注
Project Page at https://magic-research.github.io/dream-talk/