HoloGest:基于解耦扩散与运动先验的整体表达性协同语音手势生成
计算机视觉与模式识别
2025-03-18 v1
摘要
使用整体协同语音手势驱动虚拟角色动画是一项具有挑战性但至关重要的任务。以往的系统主要关注音频与手势之间的弱相关性,导致物理上不自然的结果,从而降低用户体验。为了解决这个问题,我们引入了HoloGest,这是一种基于解耦扩散和运动先验的新型神经网络框架,用于自动生成高质量、富有表现力的协同语音手势。我们的系统利用大规模人体运动数据集学习具有低音频依赖性和高运动依赖性的鲁棒先验,从而实现稳定的全局运动和精细的手指运动。为了提高基于扩散模型的生成效率,我们将隐式关节约束与显式几何及条件约束相结合,捕捉大步长之间复杂的运动分布。这种结合在保持高质量运动的同时显著提高了生成速度。此外,我们设计了一个用于手势与转录文本对齐的共享嵌入空间,从而能够生成语义正确的手势动作。大量实验和用户反馈证明了我们模型的有效性及其潜在应用,我们的方法达到了接近真实值的真实感水平,提供了沉浸式的用户体验。我们的代码、模型和演示可在 https://cyk990422.github.io/HoloGest.github.io/ 获取。
引用
@article{arxiv.2503.13229,
title = {HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures},
author = {Yongkang Cheng and Shaoli Huang},
journal= {arXiv preprint arXiv:2503.13229},
year = {2025}
}
备注
Accepted by 3DV 2025