MixedG2P-T5:基于语音自监督学习和语言模型的无G2P混合脚本文本语音合成
音频与语音处理
2025-09-03 v1 计算与语言
摘要
本研究提出了一种新的语音合成方法,可代替传统的 grapheme-to-phoneme(G2P)转换。该方法利用基于深度学习的模型直接从语音生成离散标记。通过采用预训练的语音 SSL 模型,我们训练一个 T5 编码器,从混合脚本文本(例如包含汉字和假名)生成伪语言标签。该方法消除了对手动音素转录的需求,降低了成本并提升了可扩展性,尤其适用于大型未转录音频数据集。我们的模型能够匹配传统 G2P-based 文本转语音系统的性能,并能够合成保留自然语言和副语言特征(如方言和语调)的语音。
引用
@article{arxiv.2509.01391,
title = {MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model},
author = {Joonyong Park and Daisuke Saito and Nobuaki Minematsu},
journal= {arXiv preprint arXiv:2509.01391},
year = {2025}
}
备注
In Proceedings of the 17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2025)