XPhoneBERT:一种用于语音合成音素表示的多语言预训练模型
计算与语言
2023-06-01 v1 声音
音频与语音处理
摘要
我们提出XPhoneBERT,这是首个为下游语音合成(TTS)任务学习音素表示而预训练的多语言模型。我们的XPhoneBERT具有与BERT-base相同的模型架构,使用RoBERTa预训练方法在来自近100种语言与地区的330M音素级句子上训练。实验结果表明,采用XPhoneBERT作为输入音素编码器显著提升了强神经TTS模型在自然度与韵律方面的性能,并有助于在有限训练数据下生成相当高质量的语音。我们公开发布预训练的XPhoneBERT,希望它能促进未来多语言研究与下游TTS应用。我们的XPhoneBERT模型可在 https://github.com/VinAIResearch/XPhoneBERT 获取。
引用
@article{arxiv.2305.19709,
title = {XPhoneBERT: A Pre-trained Multilingual Model for Phoneme Representations for Text-to-Speech},
author = {Linh The Nguyen and Thinh Pham and Dat Quoc Nguyen},
journal= {arXiv preprint arXiv:2305.19709},
year = {2023}
}
备注
In Proceedings of INTERSPEECH 2023 (to appear)