一种用于音频驱动虚拟人视频生成的单元增强与引导框架
计算机视觉与模式识别
2025-06-13 v5 多媒体
摘要
音频驱动人体动画技术广泛应用于人机交互领域,扩散模型的出现进一步推动了其发展。目前,大多数方法依赖多阶段生成和中间表示,导致推理时间长,并在特定前景区域生成质量以及音频-运动一致性方面存在问题。这些不足主要源于缺乏局部细粒度的监督引导。为应对上述挑战,我们提出了 PAHA,一种用于音频驱动上半身动画的单元增强与引导框架。我们引入了两种关键方法:部件感知重加权 (PAR) 和部件一致性增强 (PCE)。PAR 根据姿态置信度分数动态调整区域训练损失权重,有效提升了视觉质量。PCE 构建并训练基于扩散的区域音视频分类器,以提高运动与共语音音频的一致性。随后,我们为上述分类器设计了两种新颖的推理引导方法:顺序引导 (SG) 和差分引导 (DG),以分别平衡效率和质量。此外,我们构建了 CNAS,这是首个公开的中文新闻主播语音数据集,以推动该领域的研究与验证。大量实验结果和用户研究表明,PAHA 在音频-运动对齐和视频相关评估方面显著优于现有方法。代码和 CNAS 数据集将在接收后发布。
引用
@article{arxiv.2505.03603,
title = {A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation},
author = {S. Z. Zhou and Y. B. Wang and J. F. Wu and T. Hu and J. N. Zhang},
journal= {arXiv preprint arXiv:2505.03603},
year = {2025}
}
备注
revised