中文

3D说话风格的捕捉、学习与合成

计算机视觉与模式识别 2019-05-09 v1

摘要

音频驱动的3D面部动画已被广泛探索,但实现逼真的类人表现仍未解决。这是由于缺乏可用的3D数据集、模型与标准评估指标。为此,我们引入了一个独特的4D人脸数据集,包含约29分钟以60 fps捕获并与12位说话者音频同步的4D扫描。随后我们在该数据集上训练了一个从面部运动中分离身份的神经网络。所学模型VOCA(Voice Operated Character Animation,语音驱动角色动画)以任意语音信号为输入——甚至是英语以外的语言语音——并逼真地动画化广泛的成人面孔。训练时对主体标签进行条件化使模型能学习多种逼真说话风格。VOCA还提供动画师控制以在动画过程中改变说话风格、依赖于身份的面部形状与姿态(即头、下颌与眼球旋转)。据我们所知,VOCA是唯一无需重定向即可切实应用于未见主体的逼真3D面部动画模型。这使VOCA适用于游戏内视频、虚拟现实化身或任何说话者、语音或语言事先未知的场景。我们将数据集与模型于 http://voca.is.tue.mpg.de 提供以用于研究目的。

关键词

引用

@article{arxiv.1905.03079,
  title  = {Capture, Learning, and Synthesis of 3D Speaking Styles},
  author = {Daniel Cudeiro and Timo Bolkart and Cassidy Laidlaw and Anurag Ranjan and Michael J. Black},
  journal= {arXiv preprint arXiv:1905.03079},
  year   = {2019}
}

备注

To appear in CVPR 2019