基于 landmarks 的扩散模型实现高保真且唇形同步的说话人脸合成
计算机视觉与模式识别
2024-08-13 v1 人工智能
多媒体
摘要
音频驱动的说话人脸视频生成因其巨大的产业潜力而受到日益关注。一些先前的方法侧重于从音频直接学习到视觉内容的映射。尽管取得了进展,但这些方法常常在映射过程中存在歧义,导致结果不理想。另一种策略是使用面部结构表示(如面部 landmarks)作为中介。这种多阶段方法能更好地保留外观细节,但因不同阶段的独立优化导致误差累积。此外,大多数先前方法依赖生成对抗网络(GAN),容易出现训练不稳定和模式崩溃。为此,我们提出一种新颖的基于 landmarks 的扩散模型用于说话人脸生成,该模型在使用面部 landmarks 作为中间表示的同时实现端到端优化。具体而言,我们首先建立从音频到唇部和下巴运动的较不明确映射。随后,我们引入一种创新的条件模块称为TalkFormer,通过可微交叉注意力机制将合成的运动与 landmarks 表示的运动对齐,从而实现端到端优化以提高唇形同步效果。此外,TalkFormer采用隐式特征扭曲机制将参考图像特征与目标运动对齐,以保留更多外观细节。大量实验表明,我们的方法能够合成高保真且唇形同步的说话人脸视频,保留更多来自参考图像的主体外观细节。
引用
@article{arxiv.2408.05416,
title = {High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model},
author = {Weizhi Zhong and Junfan Lin and Peixin Chen and Liang Lin and Guanbin Li},
journal= {arXiv preprint arXiv:2408.05416},
year = {2024}
}
备注
submitted to IEEE Transactions on Image Processing(TIP)