Parrotron:一种端到端语音到语音转换模型及其在听障语音与语音分离中的应用
音频与语音处理
2019-10-30 v3 声音
摘要
我们描述了 Parrotron,一种端到端训练的语音到语音转换模型,该模型将输入谱图直接映射到另一谱图,而不利用任何中间离散表示。该网络由编码器、谱图与音素解码器以及声码器组成,以合成时域波形。我们证明该模型可被训练用于将任意说话人的语音(无论口音、韵律与背景噪声)归一化为单一规范目标说话人的声音,具有固定口音及一致的发音与韵律。我们进一步表明,该归一化模型可被适配以归一化来自聋人说话人的高度非典型语音,从而通过语音识别器与听测衡量,在可懂度与自然度上取得显著改善。最后,为展示该模型在其他语音任务上的效用,我们表明同一模型架构可被训练以执行语音分离任务。
引用
@article{arxiv.1904.04169,
title = {Parrotron: An End-to-End Speech-to-Speech Conversion Model and its Applications to Hearing-Impaired Speech and Speech Separation},
author = {Fadi Biadsy and Ron J. Weiss and Pedro J. Moreno and Dimitri Kanevsky and Ye Jia},
journal= {arXiv preprint arXiv:1904.04169},
year = {2019}
}
备注
5 pages, submitted to Interspeech 2019