Lip2AudSpec:从无声唇动视频重建语音
计算机视觉与模式识别
2017-10-27 v1 音频与语音处理
图像与视频处理
摘要
在本研究中,我们提出一种深度神经网络,用于从无声唇动视频重建可懂语音。我们使用听觉谱图作为语音的频谱表示及其相应的声音生成方法,从而生成听起来更自然的重建语音。我们提出的网络由一个自编码器组成,用于从听觉谱图中提取瓶颈特征,该特征随后作为我们主唇读网络的目标,主唇读网络由CNN、LSTM和全连接层构成。我们的实验表明,自编码器能够以98%的相关性重建原始听觉谱图,并改善主唇读网络重建语音的质量。我们的模型在不同说话人上联合训练,能够提取个体说话人特征,并在以更优词识别准确率重建可懂语音方面给出有前景的结果。
引用
@article{arxiv.1710.09798,
title = {Lip2AudSpec: Speech reconstruction from silent lip movements video},
author = {Hassan Akbari and Himani Arora and Liangliang Cao and Nima Mesgarani},
journal= {arXiv preprint arXiv:1710.09798},
year = {2017}
}