专名发音词典自动创建的基识别
计算与语言
2014-06-06 v1
摘要
专名发音词典的开发通常是一项无法避免的手工工作。文献中的字素到音素(G2P)转换模块通常基于规则,且最适用于特定语言中的非专名。专名对于 G2P 模块而言是陌生的。我们采用一种优化方法来实现专名发音词典的自动构建。其思想是构建一个小的正交词集(基),该集合可以张成给定数据库中的名称集。我们提出了两种构建此基的算法。数据库中所有专名的转录词典仅需通过手动转录这个小规模的基词集即可生成。我们首先构建了一个代价函数,并表明最小化该代价函数会产生一个基。我们推导了该代价函数的收敛条件,并在一个非常大的专名数据库上进行了实验验证。实验表明,通过转录少量基词集即可实现转录。所提出的算法是通用的且与语言无关;然而,如果专名具有相同的起源,即相同的语言或地理区域,则性能更好。
引用
@article{arxiv.1406.1280,
title = {Basis Identification for Automatic Creation of Pronunciation Lexicon for Proper Names},
author = {Sunil Kumar Kopparapu and M Laxminarayana},
journal= {arXiv preprint arXiv:1406.1280},
year = {2014}
}