中文

用于字素到音素转换的令牌级集成蒸馏

计算与语言 2019-08-13 v3 机器学习 声音 音频与语音处理

摘要

字素到音素(G2P)转换是自动语音识别与文本到语音系统中的重要任务。近来,G2P 转换被视为序列到序列任务,并由基于 RNN 或 CNN 的编码器-解码器框架建模。然而,先前工作未考虑在生产系统中部署 G2P 模型时的实际问题,例如如何利用额外无标签数据提升精度,以及缩减模型规模以用于在线部署。本工作中,我们提出用于 G2P 转换的令牌级集成蒸馏,其能够(1)通过从额外无标签数据中蒸馏知识来提升精度,以及(2)缩减模型规模但保持高精度,二者在在线生产系统中均非常实用且有帮助。我们采用令牌级知识蒸馏,其精度优于序列级对应方法。此外,我们采用 Transformer 替代基于 RNN 或 CNN 的模型,以进一步提升 G2P 转换精度。在公开可用的 CMUDict 数据集与内部英文数据集上的实验证明了我们所提方法的有效性。特别地,我们的方法在 CMUDict 数据集上取得 19.88% 的 WER,相较先前工作提升超过 4.22% WER,并刷新了当前最优(SOTA)结果。

关键词

引用

@article{arxiv.1904.03446,
  title  = {Token-Level Ensemble Distillation for Grapheme-to-Phoneme Conversion},
  author = {Hao Sun and Xu Tan and Jun-Wei Gan and Hongzhi Liu and Sheng Zhao and Tao Qin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1904.03446},
  year   = {2019}
}

备注

5 pages, accepted by interspeech 2019