ANER: 基于 Transformer 方法的阿拉伯语与 Arabizi 命名实体识别
计算与语言
2023-08-30 v1 人工智能
摘要
自然语言处理(NLP)的主要任务之一是命名实体识别(NER)。它用于许多应用,也可作为其他任务的中间步骤。我们提出 ANER,一个基于网页的阿拉伯语和 Arabizi 语言命名实体识别器。该模型构建于 BERT(一种基于 transformer 的编码器)之上。它可以识别 50 种不同的实体类别,涵盖多个领域。我们在由维基百科文章组成的 WikiFANE_Gold 数据集上训练了我们的模型。我们取得了 88.7% 的 F1 分数,优于 CAMeL Tools 在 ANERcorp 数据集上 83% 的 F1 分数,而后者仅有 4 个类别。我们在包含来自新闻文章的域外数据的 NewsFANE_Gold 数据集上也取得了 77.7% 的 F1 分数。该系统部署在一个用户友好的网页界面上,接受用户的阿拉伯语或 Arabizi 输入。它允许用户通过高亮显示来探索文本中的实体。它还可以直接引导用户通过维基百科获取实体信息。我们增加了通过我们的网站使用我们的模型或 CAMeL Tools 的模型进行 NER 的能力。ANER 可在 \url{http://www.aner.online} 公开访问。我们还将我们的模型部署在 HuggingFace 上,地址为 https://huggingface.co/boda/ANER,以允许开发者测试和使用它。
引用
@article{arxiv.2308.14669,
title = {ANER: Arabic and Arabizi Named Entity Recognition using Transformer-Based Approach},
author = {Abdelrahman "Boda" Sadallah and Omar Ahmed and Shimaa Mohamed and Omar Hatem and Doaa Hesham and Ahmed H. Yousef},
journal= {arXiv preprint arXiv:2308.14669},
year = {2023}
}