通过统一扩散生成器的多模态驱动说话人脸生成
计算机视觉与模式识别
2023-05-10 v2
摘要
多模态驱动说话人脸生成是指用从驱动图像和视频迁移的或根据文本和音频估计的给定姿态、表情和视线来驱动人像动画。然而,现有方法忽视了文本模态的潜力,且其生成器主要遵循面向源的特征重排范式并耦合不稳定的 GAN 框架。本工作中,我们首先在文本提示中表示情感,其可从 CLIP 继承丰富语义,实现灵活且泛化的情感控制。我们进一步将这些任务重组为面向目标的纹理迁移并采用扩散模型。更具体地,给定作为源的有纹理人脸和从期望 3DMM 系数投影得到的作为目标的人脸,我们提出的纹理-几何感知扩散模型将复杂迁移问题分解为多条件去噪过程,其中基于纹理注意力的模块准确建模源与目标条件中外观与几何线索的对应关系,并引入额外隐式信息以实现高保真说话人脸生成。此外,TGDM 可优雅地适用于换脸。我们推导出免于不稳定跷跷板式优化的新范式,带来简单、稳定且高效的训练与推理方案。大量实验证明了我们方法的优越性。
引用
@article{arxiv.2305.02594,
title = {Multimodal-driven Talking Face Generation via a Unified Diffusion-based Generator},
author = {Chao Xu and Shaoting Zhu and Junwei Zhu and Tianxin Huang and Jiangning Zhang and Ying Tai and Yong Liu},
journal= {arXiv preprint arXiv:2305.02594},
year = {2023}
}