从“野外”语音合成三维面部运动
计算机视觉与模式识别
2019-04-16 v1
摘要
从语音合成三维面部运动是一个关键问题,广泛体现于计算机游戏与电影等众多应用中。近期提出的方法在受控语音条件下解决该问题。本文引入首个从任意录制条件(“野外”)下捕获且独立于说话人的语音进行三维面部运动合成的方法。为此,我们捕获了人们说出 500 个单词的 4D 序列,这些单词包含于公开的大规模野外数据集 Lip Reading Words (LRW) 中,并构建了一套适用于语音的三维 blendshape 集合。我们通过一种名为深度典型注意力扭曲(Deep Canonical Attentional Warping, DCAW)的新颖时间扭曲技术,将语音 blendshape 的三维形状参数与 LRW 音频样本相关联,该技术能够以端到端方式同时学习层次化非线性表示与扭曲路径。我们全面评估了所提方法,并展示了深度学习模型在不受控条件下处理不同说话人与连续语音信号时合成三维面部运动的能力。
引用
@article{arxiv.1904.07002,
title = {Synthesising 3D Facial Motion from "In-the-Wild" Speech},
author = {Panagiotis Tzirakis and Athanasios Papaioannou and Alexander Lattas and Michail Tarasiou and Björn Schuller and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:1904.07002},
year = {2019}
}