LRSpeech:极低资源条件下的语音合成与识别
音频与语音处理
2020-08-11 v1 计算与语言
机器学习
摘要
语音合成(文本转语音,TTS)与识别(自动语音识别,ASR)是重要的语音任务,需要大量文本与语音配对数据用于模型训练。然而,世界上共有六千多种语言,大多数语言缺乏语音训练数据,这为构建极低资源语言的 TTS 和 ASR 系统带来了重大挑战。本文提出了 LRSpeech,一种在极低资源设定下的 TTS 与 ASR 系统,能够以低数据成本支持稀有语言。LRSpeech 包含三项关键技术:1)在丰富资源语言上预训练并在低资源语言上微调;2)TTS 与 ASR 之间的双重转换以迭代提升彼此的精度;3)知识蒸馏,以在高质量目标说话人语音上定制 TTS 模型,并提升 ASR 模型在多种语音上的表现。我们在一种实验性语言(英语)和一种真正的低资源语言(立陶宛语)上进行实验以验证 LRSpeech 的有效性。实验结果表明,LRSpeech 1)在合成语音的可懂度(超过 98% 可懂度率)和自然度(平均意见得分(MOS)高于 3.5)方面实现了高质量的 TTS,满足工业部署要求;2)取得了有前景的 ASR 识别精度;3)最后但同样重要的是,使用了极低资源的训练数据。我们还针对不同的数据资源量对 LRSpeech 进行了全面分析,并为工业部署提供了有价值的见解与指导。我们目前正在将 LRSpeech 部署到商业化的云语音服务中,以支持更多稀有语言的 TTS。
引用
@article{arxiv.2008.03687,
title = {LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition},
author = {Jin Xu and Xu Tan and Yi Ren and Tao Qin and Jian Li and Sheng Zhao and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2008.03687},
year = {2020}
}