中文

AsNER——阿萨姆语命名实体识别标注数据集与基线

计算与语言 2022-12-22 v1 人工智能

摘要

我们提出AsNER,一个面向低资源阿萨姆语(Assamese)的命名实体标注数据集及基线阿萨姆语NER模型。该数据集包含约99k个词符,文本来源于印度总理的演讲及阿萨姆语戏剧,亦包含人名、地名与地址。所提出的NER数据集有望成为基于深度神经的阿萨姆语处理的重要资源。我们通过训练NER模型并使用SOTA(state-of-the-art,最先进)的监督命名实体识别架构(如Fasttext、BERT、XLM-R、FLAIR、MuRIL等)进行评估来基准测试该数据集。我们采用SOTA序列标注Bi-LSTM-CRF架构实现了若干基线方法。当使用MuRIL作为词嵌入方法时,所有基线中最高的F1-score达到80.69%准确率。标注数据集与性能最优的模型已公开可用。

关键词

引用

@article{arxiv.2207.03422,
  title  = {AsNER -- Annotated Dataset and Baseline for Assamese Named Entity recognition},
  author = {Dhrubajyoti Pathak and Sukumar Nandi and Priyankoo Sarmah},
  journal= {arXiv preprint arXiv:2207.03422},
  year   = {2022}
}

备注

Published at LREC 2022. https://aclanthology.org/2022.lrec-1.706