中文

HiNER:一个大型印地语命名实体识别数据集

计算与语言 2022-05-02 v1

摘要

命名实体识别(NER)是一项基础性的自然语言处理(NLP)任务,旨在为自由文本中的词提供如人物、地点、组织、时间和数字等类标签。命名实体也可以是多词表达式,其中额外的 I-O-B 标注信息有助于在 NER 标注过程中对其打标签。虽然英语和欧洲语言拥有相当数量的 NER 标注数据,印度语言在这方面却有所欠缺——无论在数量上还是遵循标注标准方面。本文发布了一个规模可观且遵循标准的大型印地语 NER 数据集,包含 109,146 个句子和 2,220,856 个词元,标注有 11 个标签。我们详尽讨论了数据集的统计信息,并对所用 NER 标签集进行了深入分析。我们数据集中标签集的统计显示出健康的逐标签分布,尤其是对于人物、地点和组织等显著类别。由于资源有效性的证明在于利用该资源构建模型并在基准数据及共享任务排行榜条目上测试模型,我们针对上述数据做了同样的事。我们使用不同的语言模型执行 NER 的序列标注任务,并通过与在另一可用印地语 NER 数据集上训练的模型进行 comparative 评估,展示了我们数据的功效。我们的数据集在所有标签下取得了 88.78 的加权 F1 分数,而在如文中讨论的折叠标签集后达到 92.22。据我们所知,就印地语 NER 而言,尚无可用数据集在体量(数量)与变异度(多样性)上达到我们的标准。我们通过本工作填补了这一空白,希望其能显著助力印地语 NLP。我们在 https://github.com/cfiltnlp/HiNER 发布了该数据集及我们的代码与模型。

关键词

引用

@article{arxiv.2204.13743,
  title  = {HiNER: A Large Hindi Named Entity Recognition Dataset},
  author = {Rudra Murthy and Pallab Bhattacharjee and Rahul Sharnagat and Jyotsana Khatri and Diptesh Kanojia and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2204.13743},
  year   = {2022}
}

备注

Accepted at LREC 2022, 8 pages