基于扩散模型的音频驱动手势视频生成高效框架——EasyGenNet
计算机视觉与模式识别
2025-04-14 v1
摘要
音频驱动的共语视频生成通常涉及两个阶段:语音到手势和手势到视频。虽然语音到手势生成取得了显著进展,但在手势到视频系统中,合成自然的表情和手势仍具有挑战性。为了提高生成效果,先前的方法采用复杂的输入和训练策略,并需要大量数据集进行预训练,这给实际应用带来了不便。我们提出一种简单的一阶段训练方法和一种基于扩散模型的时序推理方法,无需对时序模块进行额外训练即可生成逼真且连续的手势视频。整个模型利用现有的预训练权重,仅需每个角色几千帧的数据即可完成微调。基于视频生成器,我们引入一种新的音频到视频管道,用于合成共语视频,使用 2D 人体骨架作为中间运动表示。我们的实验表明,该方法在性能上优于现有的基于 GAN 和扩散模型的方法。
引用
@article{arxiv.2504.08344,
title = {EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model},
author = {Renda Li and Xiaohua Qi and Qiang Ling and Jun Yu and Ziyi Chen and Peng Chang and Mei HanJing Xiao},
journal= {arXiv preprint arXiv:2504.08344},
year = {2025}
}