基于神经网络的语音驱动头部运动合成后滤波器
信号处理
2019-07-26 v2 机器学习
音频与语音处理
摘要
尽管神经网络已被广泛用于语音驱动的头部运动合成,但众所周知,由于深度神经网络在预测人体运动方面能力有限,其输出存在噪声或不连续的问题。因此,需要后处理以获得平滑的头部运动轨迹用于动画。通常采用线性滤波器或关键帧作为后处理手段。然而,这两种方法均非最优,因为在平滑度与精度之间始终存在权衡。为克服这一局限,我们提出采用以能够重建头部运动方式训练的神经网络。在客观评估中,该滤波器被证明善于对包含 dropout 或高斯噪声的数据去噪。客观指标也表明,经我们所提滤波器处理后,联合头部运动的平滑度有所提升。详细分析显示,我们所提滤波器学习了头部运动的特征。主观评估表明,参与者无法将经我们所提滤波器合成的头部运动与真值区分开来,且其优于高斯滤波器和移动平均。
引用
@article{arxiv.1907.10585,
title = {A neural network based post-filter for speech-driven head motion synthesis},
author = {JinHong Lu and Hiroshi Shimodaira},
journal= {arXiv preprint arXiv:1907.10585},
year = {2019}
}