中文

ANCHOLIK-NER:面向孟加拉地区方言命名实体识别的基准数据集

计算与语言 2026-02-27 v3 机器学习

摘要

在自然语言处理(NLP)中,对地区方言进行命名实体识别(NER)是一个至关重要却尚未充分探索的领域,尤其是针对资源匮乏的语言如孟加拉语。虽然针对标准孟加拉语的NER系统已有所进展,但现有资源和模型均未专门针对如巴里舍尔、希特加龙、米闻萨恩、诺阿卡里和西莱赫等地区方言进行设计,这些方言具有独特的语言特征,现有模型难以有效处理。为填补这一空白,我们介绍ANCHOLIK-NER——孟加拉地区方言命名实体识别的第一个基准数据集,数据集包含17,405个句子,分布在五个地区。该数据集来源于公开资源,并通过人工翻译补充,确保命名实体在不同方言间对齐。我们在该数据集上评估了三个基于Transformer的模型——孟加拉BERT、孟加拉BERT Base和BERT Base Multilingual Cased。我们的发现表明,BERT Base Multilingual Cased在识别跨地区的命名实体方面表现最佳,米闻萨恩地区的F1分数达到82.611%。尽管整体性能较好,但在希特加龙等地区模型表现较低,精度和召回率仍有提升空间。由于目前尚无针对孟加拉地区方言的NER系统,本工作代表了填补这一空白的 foundational 步骤。未来工作将致力于提升低绩效地区的模型性能,并扩展数据集以包含更多方言,以促进面向方言的NER系统的发展。

关键词

引用

@article{arxiv.2502.11198,
  title  = {ANCHOLIK-NER: A Benchmark Dataset for Bangla Regional Named Entity Recognition},
  author = {Bidyarthi Paul and Faika Fairuj Preotee and Shuvashis Sarker and Shamim Rahim Refat and Shifat Islam and Tashreef Muhammad and Mohammad Ashraful Hoque and Shahriar Manzoor},
  journal= {arXiv preprint arXiv:2502.11198},
  year   = {2026}
}