从语音生成整体三维人体运动
计算机视觉与模式识别
2023-06-21 v2 图形学
摘要
本工作解决从人类语音生成三维整体身体运动的问题。给定一段语音录音,我们合成逼真且多样的 3D 身体姿态、手势和面部表情序列。为此,我们首先构建一个带有同步语音的高质量 3D 整体身体网格数据集。然后我们定义一种新颖的语音到运动生成框架,其中面部、身体和手被分别建模。这种分离建模源于面部发音与人类语音强相关,而身体姿态和手势相关性较弱。具体而言,我们对面部运动采用自编码器,对身体和手部运动采用组合向量量化变分自编码器(VQ-VAE)。组合 VQ-VAE 是生成多样结果的关键。此外,我们提出一种交叉条件自回归模型来生成身体姿态和手势,从而产生连贯且逼真的运动。大量实验与用户研究表明,我们提出的方法在定性与定量上均达到最先进(SOTA)性能。我们的新颖数据集与代码将出于研究目的发布于 https://talkshow.is.tue.mpg.de。
引用
@article{arxiv.2212.04420,
title = {Generating Holistic 3D Human Motion from Speech},
author = {Hongwei Yi and Hualin Liang and Yifei Liu and Qiong Cao and Yandong Wen and Timo Bolkart and Dacheng Tao and Michael J. Black},
journal= {arXiv preprint arXiv:2212.04420},
year = {2023}
}
备注
Project Webpage: https://talkshow.is.tue.mpg.de; CVPR2023