中文

利用跨语言数据增强提升低资源巴基斯坦语言命名实体识别性能

计算与语言 2025-04-15 v1 信息检索

摘要

命名实体识别(NER)是自然语言处理(NLP)中的基础任务,已为高资源语言取得显著进展。然而,由于缺乏标注数据集且在预训练语言模型(PLMs)中代表性不足,NER 在低资源语言领域仍不够关注且具有挑战性。为此,我们提出一种数据增强技术,通过生成符合文化背景的句子,在四种低资源巴基斯坦语言(乌尔都语、沙姆基、信德语和普什图语)上进行实验。通过对多语言遮蔽大语言模型(LLM)进行微调,我们的方法在沙姆基语和普什图语上显著提升了 NER 性能。我们进一步探讨了使用少量学习的生成式 LLM 进行 NER 和数据增强的能力。

关键词

引用

@article{arxiv.2504.08792,
  title  = {Enhancing NER Performance in Low-Resource Pakistani Languages using Cross-Lingual Data Augmentation},
  author = {Toqeer Ehsan and Thamar Solorio},
  journal= {arXiv preprint arXiv:2504.08792},
  year   = {2025}
}

备注

Accepted to W-NUT 2025 @ NAACL