GMTalker:基于高斯混合的音频驱动情感化说话视频肖像
计算机视觉与模式识别
2025-03-28 v3
摘要
合成高保真且情感可控的说话视频肖像,具有音频-唇形同步、生动的表情、逼真的头部姿态和眨眼,是近年来一个重要且具有挑战性的任务。大多数现有方法在实现个性化和精确的情感控制、不同情感状态之间的平滑过渡以及多样化运动的生成方面存在困难。为了应对这些挑战,我们提出了GMTalker,一个基于高斯混合的情感化说话肖像生成框架。具体来说,我们提出了一个基于高斯混合的表情生成器,它可以构建一个连续且解耦的潜在空间,实现更灵活的情感操作。此外,我们引入了一个基于归一化流的运动生成器,该生成器在具有广泛运动的大数据集上预训练,以生成多样化的头部姿态、眨眼和眼球运动。最后,我们提出了一个带有情感映射网络的个性化情感引导头部生成器,可以合成高保真且忠实的情感化视频肖像。定量和定性实验都表明,我们的方法在图像质量、照片真实感、情感准确性和运动多样性方面优于以前的方法。
引用
@article{arxiv.2312.07669,
title = {GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits},
author = {Yibo Xia and Lizhen Wang and Xiang Deng and Xiaoyan Luo and Yunhong Wang and Yebin Liu},
journal= {arXiv preprint arXiv:2312.07669},
year = {2025}
}
备注
Project page: https://bob35buaa.github.io/GMTalker. This work has been submitted to the IEEE journal for possible publication