中文

NER-RoBERTa:在低资源语言中进行命名实体识别(NER)的RoBERTa微调

计算与语言 2024-12-23 v1 人工智能

摘要

如今,自然语言处理(NLP)是人们日常生活中重要的工具,涵盖语音理解、翻译、命名实体识别(NER)和文本分类等领域,还包括诸如ChatGPT等生成式文本模型。由于广泛使用的语言(如英语、西班牙语、土耳其语、波斯语等)拥有大数据和大型语料库,这些应用开发得很准确。然而,库尔德语仍需要更多语料和大型数据集才能被纳入NLP应用。这是因为库尔德语具有丰富的语言结构、不同的方言,以及有限的数据集,这为库尔德语NLP(KNLP)应用开发带来了独特挑战。尽管已针对各种应用在KNLP领域开展了多项研究,但库尔德语命名实体识别(KNER)仍是许多KNLP任务(包括文本分析和分类)的挑战。本文通过提出一种用于KNER微调预训练RoBERTa模型的方法来解决这一限制。为此,我们首先创建库尔德语语料库,随后设计修改后的模型架构并实施训练程序。为评估训练得到的模型,开展一组实验,以展示KNER模型使用不同分词方法和训练模型的性能。实验结果表明,采用SentencePiece分词方法的微调RoBERTa在KNER性能上显著提升,F1分数比传统模型提高12.8%,从而为KNLP树立了新的基准。

关键词

引用

@article{arxiv.2412.15252,
  title  = {NER- RoBERTa: Fine-Tuning RoBERTa for Named Entity Recognition (NER) within low-resource languages},
  author = {Abdulhady Abas Abdullah and Srwa Hasan Abdulla and Dalia Mohammad Toufiq and Halgurd S. Maghdid and Tarik A. Rashid and Pakshan F. Farho and Shadan Sh. Sabr and Akar H. Taher and Darya S. Hamad and Hadi Veisi and Aras T. Asaad},
  journal= {arXiv preprint arXiv:2412.15252},
  year   = {2024}
}