中文

基于句法的词性分析器

cmp-lg 2016-08-31 v2 计算与语言

摘要

构建自然语言分析器知识库主要有两种方法:语言学方法和数据驱动方法。近期最先进的词性标注器基于数据驱动方法。由于语言学规则方法在相关描述层面上的可行性已被证实,数据驱动方法在词性分析中的成功可能令人惊讶。本文论证了词性标注的句法本质。提出了一种仅使用语言学分布规则的英语新标注器,并进行了实证评估。在针对38,000个词的未见基准语料库进行测试时,该基于句法的系统达到了超过99%的准确率。与其最佳竞争者的95%–97%准确率相比,这一结果表明语言学方法在词性分析中同样是可行的。

关键词

引用

@article{arxiv.cmp-lg/9502012,
  title  = {A syntax-based part-of-speech analyser},
  author = {Atro Voutilainen},
  journal= {arXiv preprint arXiv:cmp-lg/9502012},
  year   = {2016}
}

备注

EACL95, uuencoded and gzipped .ps. (Bibliographic mistake corrected.)