探索用于词性标注的转换规则序列的统计推导
cmp-lg
2008-02-03 v1 计算与语言
摘要
Eric Brill 最近提出了一种简单而强大的基于语料的语言建模方法,可应用于各种任务,包括词性标注和构建短语结构树。该方法学习一系列符号化的转换规则,然后可按顺序应用于测试语料以产生预测。学习过程仅需为给定的一组规则模板计数匹配项,使该方法能够考察非常大量的可能上下文因素。本文通过涉及英语和古希腊语语料库的词性标注实验,将 Brill 的方法分析为现有决策树方法的一种有趣变体。特别是,该分析揭示了为什么新机制似乎对过训练具有惊人的抵抗力。还描述了一种快速增量实现以及一种记录所产生规则序列所依赖的依赖关系的机制。
引用
@article{arxiv.cmp-lg/9406011,
title = {Exploring the Statistical Derivation of Transformational Rule Sequences for Part-of-Speech Tagging},
author = {Lance A. Ramshaw and Mitchell P. Marcus},
journal= {arXiv preprint arXiv:cmp-lg/9406011},
year = {2008}
}
备注
10 pages, in proceedings of the ACL Balancing Act workshop