中文

TAKTAG:面向混合统计/规则词性消歧的两阶段学习方法

cmp-lg 2008-02-03 v3 计算与语言

摘要

统计方法和基于规则的方法在词性(POS)消歧中各有其优势和局限。特别是对于韩语,隐马尔可夫模型(HMM)提供的狭窄窗口无法覆盖词性消歧所需的必要词汇和长距离依赖。另一方面,基于规则的方法对新标签集和语言不够准确和灵活。在这方面,统计/规则混合方法能够利用两种方法的优势,被呼吁用于鲁棒且灵活的词性消歧。我们提出其中一种方法,即用于混合统计/规则词性消歧的两阶段学习架构,尤其适用于韩语。在该方法中,形态标注的统计学习通过Brill [1992]风格标注器的基于规则学习进行纠错。我们还设计了层次化和灵活的韩语标签集,以应对多种标注应用,每种应用需要不同的标签集。我们的实验表明,两阶段学习方法可以克服仅基于HMM或仅基于规则的标注的缺点,尤其对于形态复杂的韩语。

关键词

引用

@article{arxiv.cmp-lg/9504023,
  title  = {TAKTAG: Two-phase learning method for hybrid statistical/rule-based part-of-speech disambiguation},
  author = {Geunbae Lee and Jong-Hyeok Lee and Sanghyun Shin},
  journal= {arXiv preprint arXiv:cmp-lg/9504023},
  year   = {2008}
}

备注

10pages, latex, named.sty & named.bst, use psfig figures, submitted