中文

CoCoGesture:面向野外场景的连贯共语三维手势生成

计算机视觉与模式识别 2025-04-28 v3

摘要

从语音中推导出共语三维手势在虚拟化身动画方面取得了巨大进展。然而,由于三维语音-手势数据的限制,现有方法在面对未见过的语音输入时,常常生成僵硬且不合理的手势。在本文中,我们提出了CoCoGesture,一个新颖的框架,能够从未见过的语音提示中生成生动多样的手势。我们的关键见解建立在自定义的预训练-微调训练范式之上。在预训练阶段,我们旨在通过学习丰富的姿态流形来构建一个大型可泛化的手势扩散模型。因此,为缓解三维数据的稀缺性,我们首先构建了一个大规模共语三维手势数据集,包含来自4.3K个说话者的超过4000万个网格姿态实例,称为GES-X。然后,我们将大型无条件扩散模型扩展到10亿参数,并将其预训练为我们的手势专家。在微调阶段,我们提出了音频ControlNet,将人类语音作为条件提示来引导手势生成。在这里,我们通过预训练扩散模型的可训练副本构建音频ControlNet。此外,我们设计了一个新颖的手势专家混合(MoGE)块,通过路由机制自适应地融合来自人类语音的音频嵌入和来自预训练手势专家的手势特征。这种有效的方式确保了音频嵌入在时间上与运动特征协调,同时保留了生动多样的手势生成。大量实验表明,我们提出的CoCoGesture在零样本语音到手势生成任务上优于最先进的方法。该数据集将在 https://mattie-e.github.io/GES-X/ 公开提供。

关键词

引用

@article{arxiv.2405.16874,
  title  = {CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild},
  author = {Xingqun Qi and Hengyuan Zhang and Yatian Wang and Jiahao Pan and Chen Liu and Peng Li and Xiaowei Chi and Mengfei Li and Wei Xue and Shanghang Zhang and Wenhan Luo and Qifeng Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2405.16874},
  year   = {2025}
}

备注

After the submission of the paper, we realized that the study still has room for expansion. In order to make the research findings more profound and comprehensive, we have decided to withdraw the paper so that we can conduct further research and expansion