中文

基于特征平滑增强训练通用语音合成器

声音 2024-09-05 v1 机器学习 音频与语音处理

摘要

虽然通用语音合成器已在多样化语音上实现熟练的波形生成,但将其集成到文本语音合成(TTS)任务中常会导致合成语音质量下降。为解决这一挑战,我们提出了一种用于训练通用语音合成器的新型数据增强技术。我们的训练方案随机应用线性平滑滤波器到输入声学特征上,以促进语音合成器在各种平滑程度上的泛化能力。该方法显著缓解了训练-推理之间的不匹配问题,增强了即使声学模型产生过度平滑特征时合成输出的自然性。值得注意的是,我们的方法可应用于任何语音合成器,无需修改网络结构或依赖特定的声学模型。实验结果表明,我们的语音合成器优于传统方法,在集成 Tacotron 2 和 FastSpeech 2 语音合成声学模型时,分别实现了 11.99% 和 12.05% 的平均意见分数提升。

关键词

引用

@article{arxiv.2409.02517,
  title  = {Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems},
  author = {Jeongmin Liu and Eunwoo Song},
  journal= {arXiv preprint arXiv:2409.02517},
  year   = {2024}
}

备注

4 pages, 4 figures, for demo samples, see https://sytronik.github.io/demos/voc_smth_aug/