DiffTED:基于扩散模型的单样本音频驱动 TED 讲座视频生成与协语手势
计算机视觉与模式识别
2024-09-13 v1
摘要
音频驱动的说话视频生成取得了显著进展,但现有方法常依赖视频到视频转换技术和传统生成网络如 GAN,通常会分别生成头部和协语手势,导致输出缺乏连贯性。此外,这些方法生成的手势往往过于平滑或含蓄,缺乏多样性,而许多以手势为中心的方法未将说话头部生成集成其中。为此,我们引入 DiffTED,一种新的方法,用于从单张图像生成单样本音频驱动的 TED 风格说话视频。具体而言,我们利用扩散模型生成薄板样条运动模型的关键点序列,精确控制头像动画,确保手势在时间上连贯且多样化。这种创新方法利用无分类器引导,使手势能够自然地随音频输入流动,无需依赖预训练分类器。实验表明,DiffTED 能够生成具有连贯性和多样化协语手势的说话视频。
引用
@article{arxiv.2409.07649,
title = {DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures},
author = {Steven Hogue and Chenxu Zhang and Hamza Daruger and Yapeng Tian and Xiaohu Guo},
journal= {arXiv preprint arXiv:2409.07649},
year = {2024}
}