中文

面向历史英语的词性标注

计算与语言 2016-04-05 v2 数字图书馆

摘要

随着更多历史文本被数字化,将自然语言处理工具应用于这些档案引起了兴趣。然而,由于语言变迁和体裁差异,这些工具的性能常不能令人满意。拼写规范化启发式方法是处理历史文本的主要解决方案,但该方法未能考虑用法和词汇的变化。在这篇实证论文中,我们评估了领域自适应技术处理历史文本的能力,重点关注词性标注这一经典基准任务。我们在Penn Corpora of Historical English中对早期现代英语和现代英式英语文本标注的任务上评估了几种领域自适应方法。我们证明了用于无监督领域自适应的特征嵌入(Feature Embedding)方法优于词嵌入和Brown聚类,显示了嵌入整个特征空间而非仅单个词的重要性。特征嵌入也给出优于拼写规范化的性能,但两种方法的组合更优,在早期现代英语文本上产生了标注准确率5%的绝对提升。

关键词

引用

@article{arxiv.1603.03144,
  title  = {Part-of-Speech Tagging for Historical English},
  author = {Yi Yang and Jacob Eisenstein},
  journal= {arXiv preprint arXiv:1603.03144},
  year   = {2016}
}

备注

Accepted to NAACL 2016