开发 WAZOBIA 命名实体识别系统
计算与语言
2025-05-14 v1 人机交互
信息检索
机器学习
摘要
命名实体识别 NER 是各种自然语言处理应用的关键任务,包括信息抽取、机器翻译和情感分析。尽管非洲语言在计算语言学领域的兴趣日益增长,但现有 NER 系统主要聚焦于英语、欧洲语言和少数其他全球语言,留下了面向资源匮乏语言的显著鸿沟。本研究提出了 WAZOBIA-NER 系统,专为三个最主要的尼日利亚语言:豪萨、约鲁巴和伊布博而开发。该研究首先综合了每个语言的注释数据集,以解决数据稀缺和语言多样性挑战。探索了状态-of-the-art 机器学习技术,包括条件随机场( CRF)和深度学习模型,如双向长短期记忆网络( BiLSTM)、双向编码器表示 from Transformers( Bert) 以及使用循环神经网络( RNN)进行微调,评估了这些方法在识别三类实体(人物、组织和位置)方面的效果。该系统利用光学字符识别 OCR 技术将文本图像转换为机器可读文本,从而使 Wazobia 系统能够接受文本和文本图像作为输入进行抽取。该系统在精确率、召回率、F1 分数和准确率方面分别达到了 0.9511、0.9400、0.9564 和 0.9301。该模型的评估在三个语言上进行,precision、recall、F1-score 和 accuracy 作为关键评估指标。WAZOBIA-NER 系统表明,利用当前 NLP 框架和迁移学习技术,为资源匮乏的非洲语言构建健壮的 NER 工具是可行的。
引用
@article{arxiv.2505.07884,
title = {Development of a WAZOBIA-Named Entity Recognition System},
author = {S. E Emedem and I. E Onyenwe and E. G Onyedinma},
journal= {arXiv preprint arXiv:2505.07884},
year = {2025}
}
备注
6 pages, 3 figures, 1 table