Naamapadam:面向印度语言的大规模命名实体标注数据
计算与语言
2023-05-30 v2
摘要
我们提出 Naamapadam,这是来自两个语系的 11 种主要印度语言中规模最大的公开可用命名实体识别(NER)数据集。该数据集包含超过 40 万句句子,对其中 9 种语言标注了来自三个标准实体类别(人物、地点与组织)的至少总计 10 万个实体。训练数据集由 Samanantar 平行语料库通过将从英文句子自动标注的实体投影到对应的印度语言译文而自动创建。我们还为 9 种语言创建了人工标注的测试集。我们在 Naamapadam-test 数据集上展示了所得数据集的效用。我们还发布了 IndicNER,一个在 Naamapadam 训练集上微调的多语言 IndicBERT 模型。IndicNER 在 9 种测试语言中的 7 种上取得了超过 的 F1 分数。数据集与模型均在开源许可下发布于 https://ai4bharat.iitm.ac.in/naamapadam。
引用
@article{arxiv.2212.10168,
title = {Naamapadam: A Large-Scale Named Entity Annotated Data for Indic Languages},
author = {Arnav Mhaske and Harshit Kedia and Sumanth Doddapaneni and Mitesh M. Khapra and Pratyush Kumar and Rudra Murthy and Anoop Kunchukuttan},
journal= {arXiv preprint arXiv:2212.10168},
year = {2023}
}
备注
ACL 2023