使用 LSTM 和 GRU 及新数据集进行阿拉伯语命名实体识别
计算与语言
2023-04-10 v1
摘要
命名实体识别(NER)是一项自然语言处理任务(NLP),旨在识别命名实体并将其分类为人、地点、组织等。在阿拉伯语中,存在大量非结构化数据,且需要与(英语、俄语、德语……)等语言不同的预处理工具。由此,我们可以注意到构建新的结构化数据集以解决结构化数据缺乏问题的重要性。在本工作中,我们使用 BIOES 格式对单词进行标注,这使我们能够处理由多个句子组成的嵌套命名实体,并定义名称的起始和结束。该数据集包含超过三万六千条记录。此外,本工作提出使用长短期记忆(LSTM)单元和门控循环单元(GRU)来构建阿拉伯语的命名实体识别模型。该模型给出了约 80% 的良好结果,因为 LSTM 和 GRU 模型能够找到句子中单词之间的关系。此外,还使用了 Google 的新库 Trax 和 Colab 平台。
关键词
引用
@article{arxiv.2304.03399,
title = {Using LSTM and GRU With a New Dataset for Named Entity Recognition in the Arabic Language},
author = {Alaa Shaker and Alaa Aldarf and Igor Bessmertny},
journal= {arXiv preprint arXiv:2304.03399},
year = {2023}
}
备注
Proceedings of the 13th Majorov International Conference on Software Engineering and Computer Systems