结合词性标注嵌入的 Bi-LSTM 与 CRF 用于印尼语命名实体标注器的研究
计算与语言
2020-09-15 v1 人工智能
摘要
关于印尼语命名实体(NE)标注器的研究多年前就已开展。然而,大多数未使用深度学习,而是采用关联规则、支持向量机、随机森林、朴素贝叶斯等传统机器学习算法。在这些研究中,提供了词表作为地名词典或线索词以提升准确率。在此,我们尝试在印尼语 NE 标注器中采用深度学习。我们使用长短期记忆(LSTM)作为拓扑结构,因为它是 NE 标注器的最优方法。通过使用 LSTM,我们无需词表即可提升准确率。基本上,我们研究了两个主要问题。其一是网络的输出层:Softmax 与条件随机场(CRF)的对比。其二是词性(POS)标注嵌入输入层的使用。使用 8400 个句子作为训练数据、97 个句子作为评估数据,我们发现使用 POS 标注嵌入作为额外输入提升了印尼语 NE 标注器的性能。至于 Softmax 与 CRF 的比较,我们发现两种架构在分类 NE 标注时均存在弱点。
引用
@article{arxiv.2009.05687,
title = {Investigating Bi-LSTM and CRF with POS Tag Embedding for Indonesian Named Entity Tagger},
author = {Devin Hoesen and Ayu Purwarianti},
journal= {arXiv preprint arXiv:2009.05687},
year = {2020}
}