中文

基于有限语言资源的音系增强统计机器音译框架

计算与语言 2019-02-21 v1

摘要

音译将源语言(如英语)中的词转换为目标语言(如越南语)中的词。这种转换需考虑目标语言的音系结构,因为音译输出在目标语言中必须可发音。例如,越南语中以辅音簇开头的词在音系上无效,因此会是音译系统的错误输出。大多数统计音译方法虽被广泛采用,却未显式建模目标语言的音系,常导致无效输出。当将外来词转换为目标语言的音译词时,可用语言资源的有限性使该问题更加严重。本工作中,我们提出一种适用于音译的音系增强统计框架,尤其在仅有有限语言资源可用时。我们提出伪音节的概念,作为表示外来词片段依据目标语言音系音节组织方式的结构。我们在越南语和粤语上进行了音译实验。我们表明,在训练样本有限(587条)时,所提框架相对统计基线最高提升44.68%。

关键词

引用

@article{arxiv.1810.03184,
  title  = {Phonology-Augmented Statistical Framework for Machine Transliteration using Limited Linguistic Resources},
  author = {Gia H. Ngo and Minh Nguyen and Nancy F. Chen},
  journal= {arXiv preprint arXiv:1810.03184},
  year   = {2019}
}

备注

Accepted by IEEE Transactions on Audio, Speech and Language Processing. Copyright 2018 IEEE