中文

低资源文本到语音的多语言训练策略

计算与语言 2024-09-04 v1 机器学习 声音 音频与语音处理

摘要

近期语音技术的进展导致合成语音质量显著提升,但此类语音合成模型依赖大量数据,而这些数据成本高昂且难以扩展至所有已有语言,尤其是少数关注低资源语言。通过知识迁移等技术可减轻数据创建负担。本文因此探讨两个方面:其一,社交媒体数据能否用于小规模 TTS 数据集构建;其二,针对低资源语言的跨语言迁移学习 (TL) 是否可行。具体而言,我们考察多语言建模能否作为单语语料训练的替代方案。为此,我们探讨如何选择并整合来自外来语言的数据,以训练针对目标低资源语言的 TTS 模型。我们的发现表明,多语言预训练在提高生成语音的可理解性和自然度方面优于单语预训练。

关键词

引用

@article{arxiv.2409.01217,
  title  = {A multilingual training strategy for low resource Text to Speech},
  author = {Asma Amalas and Mounir Ghogho and Mohamed Chetouani and Rachid Oulad Haj Thami},
  journal= {arXiv preprint arXiv:2409.01217},
  year   = {2024}
}

备注

12 pages, 2 figures