MANER:面向极低资源语言的掩码增强命名实体识别
计算与语言
2022-12-20 v1
摘要
本文研究了仅有数百个标注数据样本的极低资源语言的命名实体识别(NER)问题。NER是自然语言处理(NLP)中的一项基础任务。推动 NER 系统进展的一个关键因素是大规模语言语料库的存在,使得 NER 系统能够在英语和法语等拥有丰富训练数据的语言上取得优异性能。然而,低资源语言的 NER 仍相对未被充分探索。在本文中,我们引入了掩码增强命名实体识别(MANER),这是一种利用预训练掩码语言模型(MLM)的分布假设进行 NER 的新方法。预训练 MLM 中的 <mask> 标记编码了有价值的语义上下文信息。MANER 将 <mask> 标记重新用于 NER 预测。具体而言,我们在句子中每个希望预测命名实体标签的词前添加 <mask> 标记。在训练期间,我们联合微调 MLM 和附加在每个 <mask> 标记上的新 NER 预测头。我们证明 MANER 非常适用于低资源语言的 NER;我们的实验表明,对于训练样本少至 100 例的 100 种语言,其在 F1 分数上比最先进方法最高提升 48%,平均提升 12%。我们还进行了详细的分析和消融研究,以理解最适合 MANER 的场景。
引用
@article{arxiv.2212.09723,
title = {MANER: Mask Augmented Named Entity Recognition for Extreme Low-Resource Languages},
author = {Shashank Sonkar and Zichao Wang and Richard G. Baraniuk},
journal= {arXiv preprint arXiv:2212.09723},
year = {2022}
}