中文

迈向标准化且更精确印度尼西亚语词性标注

计算与语言 2019-02-27 v3

摘要

以往的印度尼西亚语词性(POS)标注工作难以比较,因为它们未在同一通用数据集上评估。此外,尽管神经网络模型在英语 POS 标注上取得成功,它们却很少被探索用于印度尼西亚语。本文中,我们探索了印度尼西亚语 POS 标注的多种技术,包括基于规则、CRF 和基于神经网络的模型。我们在 IDN Tagged Corpus 上评估了我们的模型。利用循环神经网络取得了 97.47 F1 分数的新最优(SOTA)结果。为给未来工作提供标准,我们公开发布了所使用的数据库划分。

关键词

引用

@article{arxiv.1809.03391,
  title  = {Toward a Standardized and More Accurate Indonesian Part-of-Speech Tagging},
  author = {Kemal Kurniawan and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:1809.03391},
  year   = {2019}
}

备注

Accepted in IALP 2018