中文

通过从语音记录中学习发音改进字素到音素转换

音频与语音处理 2023-08-01 v1 计算与语言

摘要

字素到音素(G2P)任务旨在将正字法输入转换为离散语音表示。G2P转换有益于各种语音处理应用,如文本转语音和语音识别。然而,这些应用往往依赖手动标注的发音词典,其获取通常耗时且昂贵。在本文中,我们提出一种通过从音频记录中学习发音示例来改进G2P转换任务的方法。我们的方法以少量标注示例引导一个G2P模型。该G2P模型用于训练一个多语言音素识别系统,随后以语音表示解码语音记录。给定假设的音素标签,我们为词汇表外词学习发音词典,并利用这些词典重新训练G2P系统。结果表明,我们的方法在不同语言和可用数据量下一致地降低了G2P系统的音素错误率。

关键词

引用

@article{arxiv.2307.16643,
  title  = {Improving grapheme-to-phoneme conversion by learning pronunciations from speech recordings},
  author = {Manuel Sam Ribeiro and Giulia Comini and Jaime Lorenzo-Trueba},
  journal= {arXiv preprint arXiv:2307.16643},
  year   = {2023}
}

备注

5 pages, 2 figures, 4 tables. Interspeech 2023