通过系统组合提高数据驱动词类标注效果
cmp-lg
2007-05-23 v1 计算与语言
摘要
本文考察了不同数据驱动系统在完成相同 NLP 任务时的建模差异,如何利用这些差异来获得超过单个最佳系统的准确率。我们通过对词类标注任务进行的实验来实现这一点。四个著名的标注器生成器(隐藏马尔可夫模型、记忆基于、转换规则和最大熵)在相同的语料数据上进行训练。训练后,对其输出进行比较,并使用多种投票策略和二级分类器进行组合。所有组合标注器都超过其最佳组件,最佳组合标注器比最佳单个标注器的错误率降低了 19.1%。
引用
@article{arxiv.cmp-lg/9807013,
title = {Improving Data Driven Wordclass Tagging by System Combination},
author = {Hans van Halteren and Jakub Zavrel and Walter Daelemans},
journal= {arXiv preprint arXiv:cmp-lg/9807013},
year = {2007}
}
备注
7 pages, LaTeX, uses acl.bst, colacl.sty