基于典型相关约束自编码器从语音波形预测头部运动
音频与语音处理
2020-11-03 v2 声音
摘要
本研究探讨直接利用语音波形预测头部运动以用于语音驱动的头部运动合成,而文献中通常将 MFCC 等频谱特征作为基本输入特征,并辅以能量、F0 等额外特征。我们表明,相较于组合源自波形的不同特征,直接使用波形预测对应头部运动更为有效。基于波形的方法面临的挑战在于,波形含有大量与头部运动预测无关的信息,阻碍了神经网络训练。为克服该问题,我们提出典型相关约束自编码器(CCCAE),其隐藏层不仅被训练以最小化误差,同时最大化与头部运动的典型相关。与基于 MFCC 的系统相比,所提系统在客观评价中表现相当,在主观评价中表现更优。
关键词
引用
@article{arxiv.2002.01869,
title = {Prediction of head motion from speech waveforms with a canonical-correlation-constrained autoencoder},
author = {JinHong Lu and Hiroshi Shimodaira},
journal= {arXiv preprint arXiv:2002.01869},
year = {2020}
}
备注
head motion synthesis, speech-driven animation, deep canonically correlated autoencoder