利用跨语言数据增强提升低资源巴基斯坦语言命名实体识别性能
计算与语言
2025-04-15 v1 信息检索
摘要
命名实体识别(NER)是自然语言处理(NLP)中的基础任务,已为高资源语言取得显著进展。然而,由于缺乏标注数据集且在预训练语言模型(PLMs)中代表性不足,NER 在低资源语言领域仍不够关注且具有挑战性。为此,我们提出一种数据增强技术,通过生成符合文化背景的句子,在四种低资源巴基斯坦语言(乌尔都语、沙姆基、信德语和普什图语)上进行实验。通过对多语言遮蔽大语言模型(LLM)进行微调,我们的方法在沙姆基语和普什图语上显著提升了 NER 性能。我们进一步探讨了使用少量学习的生成式 LLM 进行 NER 和数据增强的能力。
引用
@article{arxiv.2504.08792,
title = {Enhancing NER Performance in Low-Resource Pakistani Languages using Cross-Lingual Data Augmentation},
author = {Toqeer Ehsan and Thamar Solorio},
journal= {arXiv preprint arXiv:2504.08792},
year = {2025}
}
备注
Accepted to W-NUT 2025 @ NAACL