CL-NERIL:一种面向印度语言的跨语言命名实体识别模型
计算与语言
2021-11-24 v1
摘要
为印度语言开发命名实体识别(NER)系统一直是一项长期挑战,主要归因于需要大量带标注的干净训练实例。本文通过利用英语与印度语言的平行语料库以及一个英语NER数据集,提出了一种低资源环境下面向印度语言的端到端NER框架。所提框架包含一种标注投影方法,其结合源语言(英语)数据上的词对齐分数与NER标签预测置信度分数,以在目标印度语言中生成弱标注数据。我们采用了教师-学生模型的一个变体,并在教师模型的伪标签与所生成弱标注数据上的预测上联合优化。我们还给出了印地语、孟加拉语和古吉拉特语三种印度语言的人工标注测试集。我们在三种印度语言的测试集上评估了所提框架的性能。实证结果显示,相较于零样本迁移学习模型,所有语言均有至少10%的性能提升。这表明,使用所提标注投影方法在目标印度语言中生成的弱标注数据,能够很好地补充标注良好的源语言数据以提升性能。我们的代码公开于https://github.com/aksh555/CL-NERIL。
引用
@article{arxiv.2111.11815,
title = {CL-NERIL: A Cross-Lingual Model for NER in Indian Languages},
author = {Akshara Prabhakar and Gouri Sankar Majumder and Ashish Anand},
journal= {arXiv preprint arXiv:2111.11815},
year = {2021}
}
备注
Accepted in AAAI 2022 Student Abstract