通过分层隐式周期性学习迈向统一的协同语音手势生成
人工智能
2025-12-16 v1 计算机视觉与模式识别
图形学
多媒体
声音
摘要
从语音生成基于三维的身体运动在广泛的下游应用中展现出巨大潜力,但仍面临模仿真实人类运动的挑战。主要研究精力集中在端到端生成方案上,包括 GAN、VQ-VAE 以及最近的扩散模型。作为一个不适定问题,本文认为这些主流的学习方案未能建模不同运动单元——即头部、身体和手部——之间的关键相互和内部相关性,从而导致不自然的运动和较差的协调性。为深入探究这些内在相关性,我们提出了一种统一的基于分层隐式周期性(Hierarchical Implicit Periodicity, HIP)学习的音频启发式三维手势生成方法。与主流研究不同,我们的方法通过两个明确的技术洞察来建模这种多模态隐式关系:i) 为解耦复杂的手势运动,我们首先利用周期性自编码器探索手势运动相位流形,从真实分布中模仿人类自然运动,同时从当前潜在状态中纳入非周期性运动以实现实例级多样性。ii) 为建模面部运动、身体手势和手部运动之间的层次关系,在学习过程中通过级联引导驱动动画。我们在三维 avatar 上展示了所提出的方法,大量实验表明我们的方法在定量和定性评估上均优于最先进的协同语音手势生成方法。代码和模型将公开发布。
引用
@article{arxiv.2512.13131,
title = {Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning},
author = {Xin Guo and Yifan Zhao and Jia Li},
journal= {arXiv preprint arXiv:2512.13131},
year = {2025}
}
备注
IEEE Transactions on Image Processing