一字模型发诸音:基于 Transformer 集成的多语言字素到音素转换
计算与语言
2020-06-25 v1
摘要
字素到音素(G2P)转换任务对语音识别与合成均十分重要。与其他语音和语言处理任务类似,在仅可获得小规模训练数据的场景下,学习 G2P 模型具有挑战性。我们描述了一种利用基于多语言 Transformer 与自训练的模型集成来为 15 种语言开发高效 G2P 方案的简单方法。我们的模型是作为参与 SIGMORPHON 2020 共享任务 1(聚焦于 G2P)的一部分而开发的。我们的最佳模型实现了 14.99 的词错误率(WER)与 3.30 的音素错误率(PER),相较共享任务的竞争性基线有可观改进。
引用
@article{arxiv.2006.13343,
title = {One Model to Pronounce Them All: Multilingual Grapheme-to-Phoneme Conversion With a Transformer Ensemble},
author = {Kaili Vesik and Muhammad Abdul-Mageed and Miikka Silfverberg},
journal= {arXiv preprint arXiv:2006.13343},
year = {2020}
}
备注
7 pages, submitted to SIGMORPHON 2020 Shared Task 1