迈向标准化且更精确印度尼西亚语词性标注
计算与语言
2019-02-27 v3
摘要
以往的印度尼西亚语词性(POS)标注工作难以比较,因为它们未在同一通用数据集上评估。此外,尽管神经网络模型在英语 POS 标注上取得成功,它们却很少被探索用于印度尼西亚语。本文中,我们探索了印度尼西亚语 POS 标注的多种技术,包括基于规则、CRF 和基于神经网络的模型。我们在 IDN Tagged Corpus 上评估了我们的模型。利用循环神经网络取得了 97.47 F1 分数的新最优(SOTA)结果。为给未来工作提供标准,我们公开发布了所使用的数据库划分。
引用
@article{arxiv.1809.03391,
title = {Toward a Standardized and More Accurate Indonesian Part-of-Speech Tagging},
author = {Kemal Kurniawan and Alham Fikri Aji},
journal= {arXiv preprint arXiv:1809.03391},
year = {2019}
}
备注
Accepted in IALP 2018