探索低资源语音合成的语音增强方法
音频与语音处理
2023-09-20 v1
摘要
高质量且可懂的语音对文本到语音(TTS)模型训练至关重要,然而为低资源语言获取高质量数据具有挑战且昂贵。在自动语音识别(ASR)语料上应用语音增强可通过扩充训练数据缓解该问题,但语音增强模型带来的非线性语音失真如何影响 TTS 训练仍需研究。本文训练 TF-GridNet 语音增强模型并应用于为 ASR 任务收集的低资源数据集,随后在增强语音上训练基于离散单元的 TTS 模型。我们以阿拉伯语数据集为例,表明所提流程在 ASR WER 指标上相较其他基线方法显著改善了低资源 TTS 系统。我们还对语音增强与 TTS 性能间的相关性进行了实证分析。
引用
@article{arxiv.2309.10795,
title = {Exploring Speech Enhancement for Low-resource Speech Synthesis},
author = {Zhaoheng Ni and Sravya Popuri and Ning Dong and Kohei Saijo and Xiaohui Zhang and Gael Le Lan and Yangyang Shi and Vikas Chandra and Changhan Wang},
journal= {arXiv preprint arXiv:2309.10795},
year = {2023}
}
备注
Submitted to ICASSP 2024