中文

通过系统组合提高数据驱动词类标注效果

cmp-lg 2007-05-23 v1 计算与语言

摘要

本文考察了不同数据驱动系统在完成相同 NLP 任务时的建模差异,如何利用这些差异来获得超过单个最佳系统的准确率。我们通过对词类标注任务进行的实验来实现这一点。四个著名的标注器生成器(隐藏马尔可夫模型、记忆基于、转换规则和最大熵)在相同的语料数据上进行训练。训练后,对其输出进行比较,并使用多种投票策略和二级分类器进行组合。所有组合标注器都超过其最佳组件,最佳组合标注器比最佳单个标注器的错误率降低了 19.1%。

关键词

引用

@article{arxiv.cmp-lg/9807013,
  title  = {Improving Data Driven Wordclass Tagging by System Combination},
  author = {Hans van Halteren and Jakub Zavrel and Walter Daelemans},
  journal= {arXiv preprint arXiv:cmp-lg/9807013},
  year   = {2007}
}

备注

7 pages, LaTeX, uses acl.bst, colacl.sty