阿拉伯语命名实体识别综述:过去、近期进展与未来趋势
计算与语言
2023-08-09 v3
摘要
随着互联网上阿拉伯语文本越来越多,从这些文本中提取重要信息尤为有用。作为一项基础技术,命名实体识别(NER)是信息抽取技术的核心组件,同时在许多其他自然语言处理(NLP)系统(如问答和知识图谱构建)中也发挥着关键作用。本文对阿拉伯语 NER 的发展进行了全面回顾,特别是深度学习与预训练语言模型方面的近期进展。具体而言,我们首先介绍阿拉伯语 NER 的背景,包括阿拉伯语的特点以及现有的阿拉伯语 NER 资源。随后,我们系统回顾了阿拉伯语 NER 方法的发展。传统的阿拉伯语 NER 系统侧重于特征工程和设计特定领域的规则。近年来,深度学习方法通过连续向量表示来表征文本,取得了显著进展。随着预训练语言模型的发展,阿拉伯语 NER 获得了更好的性能。最后,我们总结了阿拉伯语 NER 与其他语言 NER 方法之间的方法差距,这有助于勾勒阿拉伯语 NER 的未来方向。
引用
@article{arxiv.2302.03512,
title = {A Survey on Arabic Named Entity Recognition: Past, Recent Advances, and Future Trends},
author = {Xiaoye Qu and Yingjie Gu and Qingrong Xia and Zechang Li and Zhefeng Wang and Baoxing Huai},
journal= {arXiv preprint arXiv:2302.03512},
year = {2023}
}
备注
Accepted by IEEE TKDE