中文

基于词尾的词性标注策略

计算与语言 2013-02-28 v1

摘要

词性标注的概率方法主要依赖于词/标签组合的整体词统计以及上下文信息。但经验表明,即使训练集高达一百万词,测试集中遇到的标记仍有约 4% 是未知的。未见词通常利用词尾、大写和标点符号等词特征作为次要策略进行标注。在本工作中,词尾统计是主要的,而整体词统计是次要的。首先,仅使用词尾训练并测试了一个标注器。随后的实验为训练集中出现频率最高的词重新加入了整体词统计。随着训练集增大,预期性能会提高,并在极限情况下达到与基于词的标注器相同的水平。令人惊讶的是,基于词尾的标注器最初的表现几乎与基于词的标注器一样好;在最佳情况下,其性能显著超过了基于词的标注器。最后且出乎意料的是,观察到了收益递减效应——随着训练集增大,性能通常先提高后下降。通过改变词尾长度和标签列表策略等因素,我们达到了 97.5% 的成功率。

关键词

引用

@article{arxiv.1302.6777,
  title  = {Ending-based Strategies for Part-of-speech Tagging},
  author = {Greg Adams and Beth Millar and Eric Neufeld and Tim Philip},
  journal= {arXiv preprint arXiv:1302.6777},
  year   = {2013}
}

备注

Appears in Proceedings of the Tenth Conference on Uncertainty in Artificial Intelligence (UAI1994)