用于增强扩散模型以实现高效逼真音频驱动全局手势生成的条件 GAN
声音
2024-11-04 v2 人工智能
计算机视觉与模式识别
图形学
音频与语音处理
摘要
音频驱动的同步手势生成对人机通信、AI 游戏和电影制作至关重要。尽管先前的研究展现出潜力,但仍存在局限性。基于 VAE 的方法伴随着局部抖动和全局不稳定的问题,而基于扩散模型的方法则受限于生成效率低下。这是因为后者的 DDPM 去噪过程依赖于一个假设,即每一步添加的噪声均采样自单峰分布,且噪声值较小。DDIM 借鉴欧拉方法求解微分方程的思想,打破了马尔可夫链过程,并增大噪声步长以减少去噪步数,从而加速生成。然而,在逐步去噪过程中单纯增大步长会导致结果逐渐偏离原始数据分布,造成生成动作质量的大幅下降以及不自然伪影的出现。在本文中,我们打破了 DDPM 的假设,在去噪速度和保真度上取得了突破性进展。具体而言,我们引入了条件 GAN 来捕捉音频控制信号,并在同一采样步内的扩散与去噪步骤之间隐式匹配多模态去噪分布,旨在采样更大的噪声值并应用更少的去噪步数以实现高速生成。
引用
@article{arxiv.2410.20359,
title = {Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios},
author = {Yongkang Cheng and Mingjiang Liang and Shaoli Huang and Gaoge Han and Jifeng Ning and Wei Liu},
journal= {arXiv preprint arXiv:2410.20359},
year = {2024}
}
备注
Accepted by WACV 2025 (Round 1)