AsynFusion:面向异步潜在一致性模型的解耦式全身音频驱动化身
声音
2025-10-15 v2 人工智能
计算机视觉与模式识别
图形学
音频与语音处理
摘要
全身音频驱动的化身姿态和表情生成是创建逼真数字人类并提升交互式虚拟代理能力的关键任务,具有广泛的应用前景,包括虚拟现实、数字娱乐和远程沟通。现有方法常独立生成音频驱动的面部表情和手势,导致存在显著局限性:面部和手势元素之间缺乏无缝协调,导致动画不够自然和连贯。为此,我们提出AsynFusion,一种新颖框架,利用扩散变换器实现和谐的表情和手势合成。该方法基于双分支DiT架构,实现面部表情和手势的并行生成。模型内部引入Cooperative Synchronization Module以促进两种模态之间的双向特征交互,并提出Asynchronous LCM Sampling策略以降低计算开销,同时保持高质量输出。大量实验表明,AsynFusion在生成实时同步全身动画方面实现了最先进的性能,在定量和定性评估中始终优于现有方法。
引用
@article{arxiv.2505.15058,
title = {AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars},
author = {Tianbao Zhang and Jian Zhao and Yuer Li and Zheng Zhu and Ping Hu and Zhaoxin Fan and Wenjun Wu and Xuelong Li},
journal= {arXiv preprint arXiv:2505.15058},
year = {2025}
}
备注
15pages, conference