基于声码器的无声视频语音合成
音频与语音处理
2020-08-18 v2 计算机视觉与模式识别
机器学习
摘要
声学信息和视觉信息都会影响人类对语音的感知。因此,视频序列中音频的缺失导致未经训练的对口型阅读者语音可懂度极低。在本文中,我们提出一种利用深度学习从说话者无声视频中合成语音的方法。该系统学习从原始视频帧到声学特征的映射函数,并通过声码器合成算法重建语音。为提升语音重建性能,我们的模型还以多任务学习的方式训练以预测文本信息,并能够实时同时重建和识别语音。在估计语音质量和可懂度方面的结果表明了我们方法的有效性,其相对于现有视频到语音方法有所提升。
引用
@article{arxiv.2004.02541,
title = {Vocoder-Based Speech Synthesis from Silent Videos},
author = {Daniel Michelsanti and Olga Slizovskaia and Gloria Haro and Emilia Gómez and Zheng-Hua Tan and Jesper Jensen},
journal= {arXiv preprint arXiv:2004.02541},
year = {2020}
}
备注
Accepted to Interspeech 2020