TAKTAG:面向混合统计/规则词性消歧的两阶段学习方法
cmp-lg
2008-02-03 v3 计算与语言
摘要
统计方法和基于规则的方法在词性(POS)消歧中各有其优势和局限。特别是对于韩语,隐马尔可夫模型(HMM)提供的狭窄窗口无法覆盖词性消歧所需的必要词汇和长距离依赖。另一方面,基于规则的方法对新标签集和语言不够准确和灵活。在这方面,统计/规则混合方法能够利用两种方法的优势,被呼吁用于鲁棒且灵活的词性消歧。我们提出其中一种方法,即用于混合统计/规则词性消歧的两阶段学习架构,尤其适用于韩语。在该方法中,形态标注的统计学习通过Brill [1992]风格标注器的基于规则学习进行纠错。我们还设计了层次化和灵活的韩语标签集,以应对多种标注应用,每种应用需要不同的标签集。我们的实验表明,两阶段学习方法可以克服仅基于HMM或仅基于规则的标注的缺点,尤其对于形态复杂的韩语。
引用
@article{arxiv.cmp-lg/9504023,
title = {TAKTAG: Two-phase learning method for hybrid statistical/rule-based part-of-speech disambiguation},
author = {Geunbae Lee and Jong-Hyeok Lee and Sanghyun Shin},
journal= {arXiv preprint arXiv:cmp-lg/9504023},
year = {2008}
}
备注
10pages, latex, named.sty & named.bst, use psfig figures, submitted