中文

SpeechAct:面向从语音生成全身运动

计算机视觉与模式识别 2025-01-23 v5

摘要

本文解决从语音生成全身运动的问题。尽管取得了巨大成功,现有方法仍难以从语音生成合理且多样的全身运动。这归因于其对次优表示的依赖以及缺乏生成多样结果的策略。为应对这些挑战,我们提出一种新颖的混合点表示以实现准确且连续的运动生成,例如避免脚部滑动,且该表示可转换为易用表示,即SMPL-X身体网格,以用于诸多应用。为从语音生成全身运动,对于与音频信号紧密相关的面部运动,我们引入编码器-解码器架构以实现确定性输出。然而,对于与音频信号联系较弱的身体和手部,我们旨在生成多样且合理的运动。为提升运动生成的多样性,我们提出一种对比运动学习方法以鼓励模型产生更具区分性的表示。具体而言,我们设计了一个鲁棒VQ-VAE,使用我们的混合表示学习量化运动码本。然后,我们通过采用对比运动学习方法的翻译模型从音频信号回归运动表示。实验结果验证了模型的优越性能与正确性。项目页面出于研究目的发布于 http://cic.tju.edu.cn/faculty/likun/projects/SpeechAct。

关键词

引用

@article{arxiv.2311.17425,
  title  = {SpeechAct: Towards Generating Whole-body Motion from Speech},
  author = {Jinsong Zhang and Minjie Zhu and Yuxiang Zhang and Yebin Liu and Kun Li},
  journal= {arXiv preprint arXiv:2311.17425},
  year   = {2025}
}

备注

Accepted by TVCG