中文

EDU-NER-2025:基于 XLM-RoBERTa 的乌尔都教育文本命名实体识别

计算与语言 2025-04-28 v1 人工智能

摘要

命名实体识别(NER)在各种自然语言处理(NLP)任务中扮演着关键角色,通过从非结构化数据中识别并分类预定义类别如人、组织、地点、日期和时间的命名实体。虽然针对高资源语言和通用领域进行了大量研究,但针对乌尔都语特别是在教育等特定领域的 NER 研究仍严重不足。这源于缺乏教育内容的标注数据集,这限制了现有模型准确识别学术角色、课程名称和机构术语的能力,凸显了该领域亟需针对性资源的紧迫性。据我们所知,尚无针对乌尔都语该领域的数据集存在。为实现此目标,本研究作出了三个关键贡献。首先,我们创建了一个包含 13 个唯一最重要教育领域实体的手动标注数据集,命名为 EDU-NER-2025。其次,我们详细描述标注过程和指南,并讨论了标注 EDU-NER-2025 数据集的挑战。最后,我们解决并分析了在正式乌尔都文本中常见的形态学复杂性和歧义等关键语言挑战。

关键词

引用

@article{arxiv.2504.18142,
  title  = {EDU-NER-2025: Named Entity Recognition in Urdu Educational Texts using XLM-RoBERTa with X (formerly Twitter)},
  author = {Fida Ullah and Muhammad Ahmad and Muhammad Tayyab Zamir and Muhammad Arif and Grigori sidorov and Edgardo Manuel Felipe Riverón and Alexander Gelbukh},
  journal= {arXiv preprint arXiv:2504.18142},
  year   = {2025}
}