中文

一种基于类比的发音概率方法

计算与语言 2011-09-22 v1

摘要

在英语等正字法深度较深的语言中,书面词与口语词之间的关系错综复杂,因此难以制定明确的规则来生成未见词的发音。基于类比的发音 (PbA) 是一种数据驱动的方法,通过连接已知词及其发音的片段来构建新词的发音。PbA 在英语上表现相对较好,且优于其他几种 proposed 方法。然而,已发表的最佳词准确率 65.5%(针对 20,000 词的 NETtalk 语料库)表明其仍有很大改进空间。以往的 PbA 算法使用了多种不同的评分策略,例如片段组成发音频率的乘积,或产生相同发音的不同分段数量,以及这些方法的不同组合,以评估候选发音。在本文中,我们转而提出使用一种具有概率合理性的评分规则。我们表明,仅这一原则性方法就能产生比任何已发表的 PbA 算法更高的准确率(NETtalk 语料库为 66.21%)。此外,结合早期算法激发的某些特设修改,性能可提升至 66.6%,且通过将此方法与其他方法结合,还有进一步改进的可能。

关键词

引用

@article{arxiv.1109.4531,
  title  = {A Probabilistic Approach to Pronunciation by Analogy},
  author = {Janne V. Kujala and Aleksi Keurulainen},
  journal= {arXiv preprint arXiv:1109.4531},
  year   = {2011}
}