基于句法的词性分析器
cmp-lg
2016-08-31 v2 计算与语言
摘要
构建自然语言分析器知识库主要有两种方法:语言学方法和数据驱动方法。近期最先进的词性标注器基于数据驱动方法。由于语言学规则方法在相关描述层面上的可行性已被证实,数据驱动方法在词性分析中的成功可能令人惊讶。本文论证了词性标注的句法本质。提出了一种仅使用语言学分布规则的英语新标注器,并进行了实证评估。在针对38,000个词的未见基准语料库进行测试时,该基于句法的系统达到了超过99%的准确率。与其最佳竞争者的95%–97%准确率相比,这一结果表明语言学方法在词性分析中同样是可行的。
引用
@article{arxiv.cmp-lg/9502012,
title = {A syntax-based part-of-speech analyser},
author = {Atro Voutilainen},
journal= {arXiv preprint arXiv:cmp-lg/9502012},
year = {2016}
}
备注
EACL95, uuencoded and gzipped .ps. (Bibliographic mistake corrected.)