中文

Lip2AudSpec:从无声唇动视频重建语音

计算机视觉与模式识别 2017-10-27 v1 音频与语音处理 图像与视频处理

摘要

在本研究中,我们提出一种深度神经网络,用于从无声唇动视频重建可懂语音。我们使用听觉谱图作为语音的频谱表示及其相应的声音生成方法,从而生成听起来更自然的重建语音。我们提出的网络由一个自编码器组成,用于从听觉谱图中提取瓶颈特征,该特征随后作为我们主唇读网络的目标,主唇读网络由CNN、LSTM和全连接层构成。我们的实验表明,自编码器能够以98%的相关性重建原始听觉谱图,并改善主唇读网络重建语音的质量。我们的模型在不同说话人上联合训练,能够提取个体说话人特征,并在以更优词识别准确率重建可懂语音方面给出有前景的结果。

关键词

引用

@article{arxiv.1710.09798,
  title  = {Lip2AudSpec: Speech reconstruction from silent lip movements video},
  author = {Hassan Akbari and Himani Arora and Liangliang Cao and Nima Mesgarani},
  journal= {arXiv preprint arXiv:1710.09798},
  year   = {2017}
}