g2pM:基于新开放基准数据集的普通话字素到音素转换工具包
计算与语言
2020-09-18 v5
摘要
中文字素到音素(G2P)转换是普通话文本转语音(TTS)系统中的一个基本组件。中文 G2P 转换的最大挑战之一是如何消除多音字(具有多种读音的字符)发音的歧义。尽管学术界已做出许多努力来解决该问题,但迄今为止尚无可用作公平比较标准基准的开放数据集。此外,大多数已报道的系统难以被希望便捷地将中文文本转换为拼音的研究人员或从业者所使用。受此驱动,在本工作中,我们引入了一个由 99,000+ 个句子组成的中文多音字消歧新基准数据集。我们在其上训练了一个简单的神经网络模型,并发现它优于其他已有的 G2P 系统。最后,我们将项目打包并分享在 PyPi 上。
引用
@article{arxiv.2004.03136,
title = {g2pM: A Neural Grapheme-to-Phoneme Conversion Package for Mandarin Chinese Based on a New Open Benchmark Dataset},
author = {Kyubyong Park and Seanie Lee},
journal= {arXiv preprint arXiv:2004.03136},
year = {2020}
}
备注
INTERSPEECH 2020