中文

用于汉语多音字消歧的 Polyphone BERT

音频与语音处理 2022-07-26 v1 计算与语言 机器学习

摘要

字素到音素(G2P)转换是汉语普通话文本转语音(TTS)系统不可或缺的一部分,而 G2P 转换的核心是解决多音字消歧问题,即为汉语多音字从若干候选发音中选取正确读音。本文提出一种汉语多音字 BERT 模型来预测汉语多音字的发音。首先,我们根据发音从 354 个源汉语多音字创建了 741 个新汉语单音字。然后,通过用 741 个新汉语单音字扩展预训练的汉语 BERT 并为新词元添加相应的嵌入层(由源汉语多音字嵌入初始化),得到汉语多音字 BERT。以此,我们可以将多音字消歧任务转化为汉语多音字 BERT 的预训练任务。实验结果表明所提模型的有效性,该多音字 BERT 模型相比基于 BERT 的分类器模型(此前多音字消歧的最优方法)平均准确率提升了 2%(从 92.1% 到 94.1%)。

关键词

引用

@article{arxiv.2207.12089,
  title  = {A Polyphone BERT for Polyphone Disambiguation in Mandarin Chinese},
  author = {Song Zhang and Ken Zheng and Xiaoxu Zhu and Baoxiang Li},
  journal= {arXiv preprint arXiv:2207.12089},
  year   = {2022}
}

备注

Accepted for INTERSPEECH 2022