中文

基于潜在空间偏差特征的音频驱动手势生成

计算机视觉与模式识别 2025-03-28 v1

摘要

手势对于增强语音协同沟通至关重要,提供视觉强调并补充 verbal 交互。虽然 prior work 集中于点级运动或完全监督的数据驱动方法,但我们关注语音协同手势,倡导弱监督学习和像素级运动偏差。我们引入一个弱监督框架,用于学习潜在表示偏差,专为语音手势视频生成设计。我们的方法采用扩散模型集成潜在运动特征,实现更精确和细致的手势表征。通过利用潜在空间中的弱监督偏差,我们有效地生成手部手势和嘴部动作,这些都是实现真实感视频制作的关键。实验表明,我们的方法显著提高了视频质量,超越了当前的 state-of-the-art 技术。

关键词

引用

@article{arxiv.2503.21616,
  title  = {Audio-driven Gesture Generation via Deviation Feature in the Latent Space},
  author = {Jiahui Chen and Yang Huan and Runhua Shi and Chanfan Ding and Xiaoqi Mo and Siyu Xiong and Yinong He},
  journal= {arXiv preprint arXiv:2503.21616},
  year   = {2025}
}

备注

6 pages, 5 figures