中文

单语与多语BERT对比:印地语与马拉地语命名实体识别案例研究

计算与语言 2023-02-28 v1 机器学习

摘要

命名实体识别(NER)是识别并分类文本中重要信息(实体)的过程。专有名词,如人名、组织名或地名,均为实体的例子。NER是人力资源、客户支持、搜索引擎、内容分类及学术界等应用中的重要模块之一。本工作中,我们考虑低资源印度语言如印地语与马拉地语的NER。基于Transformer的模型已被广泛用于NER任务。我们考虑BERT的不同变体如base-BERT、RoBERTa与AlBERT,并在公开可用的印地语与马拉地语NER数据集上对其进行基准测试。我们对不同的单语与多语基于Transformer的模型进行了详尽比较,并建立了当前文献中缺失的简单基线。我们表明,单语MahaRoBERTa模型在马拉地语NER上表现最佳,而多语XLM-RoBERTa在印地语NER上表现最佳。我们还进行了跨语言评估并给出了混合的观察结果。

关键词

引用

@article{arxiv.2203.12907,
  title  = {Mono vs Multilingual BERT: A Case Study in Hindi and Marathi Named Entity Recognition},
  author = {Onkar Litake and Maithili Sabane and Parth Patil and Aparna Ranade and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2203.12907},
  year   = {2023}
}

备注

Accepted at ICMISC 2022