NER-BERT:一种用于低资源实体标注的预训练模型
计算与语言
2021-12-02 v1 人工智能
摘要
当低资源领域缺乏大型训练数据集时,命名实体识别(NER)模型通常表现不佳。近来,预训练大规模语言模型已成为应对数据稀缺问题的一个有前景的方向。然而,语言建模与 NER 任务之间的内在差异可能限制模型性能,且由于所收集的 NER 数据集通常规模较小或虽大但质量低,针对 NER 任务的预训练鲜有研究。在本文中,我们构建了一个质量相对较高的海量 NER 语料库,并基于所创建的数据集预训练了 NER-BERT 模型。实验结果表明,在跨越九个多样领域的低资源场景下,我们的预训练模型能显著优于 BERT 以及其他强基线。此外,对实体表示的可视化进一步表明了 NER-BERT 在分类多种实体方面的有效性。
引用
@article{arxiv.2112.00405,
title = {NER-BERT: A Pre-trained Model for Low-Resource Entity Tagging},
author = {Zihan Liu and Feijun Jiang and Yuxiang Hu and Chen Shi and Pascale Fung},
journal= {arXiv preprint arXiv:2112.00405},
year = {2021}
}