关键点引导扩散模型的高保真与时间一致说话头像生成
计算机视觉与模式识别
2024-08-06 v1 人工智能
摘要
音频驱动的说话头像生成是一项具有重要意义且具有挑战性的任务,适用于虚拟化身、电影制作和在线会议等多种领域。然而,现有的基于GAN的模型强调生成良好同步的唇形,但忽视了生成帧的视觉质量;而基于扩散的模型优先考虑生成高质量帧,但忽略了唇形匹配,导致嘴巴运动抖动。为解决上述问题,本文提出了一种两阶段扩散模型。第一阶段涉及基于给定语音生成同步的面部关键点。第二阶段将这些生成的关键点作为去噪过程中的条件,旨在优化嘴巴抖动问题并生成高保真、良好同步且时间一致的说话头像视频。大量实验表明,本文模型取得了最佳性能。
引用
@article{arxiv.2408.01732,
title = {Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation},
author = {Jintao Tan and Xize Cheng and Lingyu Xiong and Lei Zhu and Xiandong Li and Xianjia Wu and Kai Gong and Minglei Li and Yi Cai},
journal= {arXiv preprint arXiv:2408.01732},
year = {2024}
}