面向长命名实体识别的正则化方法
计算与语言
2022-01-12 v2 人工智能
摘要
在执行命名实体识别(NER)时,实体长度是可变的,并依赖于特定领域或数据集。预训练语言模型(PLMs)被用于解决 NER 任务,且往往偏向于数据集模式,如长度统计、表层形式以及偏斜的类别分布。这些偏差阻碍了 PLMs 的泛化能力,而该能力对于应对真实场景中许多未见提及是必要的。我们提出一种新颖的去偏方法 RegLER,以改进对变长实体的预测。为缩小评估与真实场景之间的差距,我们在包含未见提及集的划分基准数据集上评估了 PLMs。在此,RegLER 通过对实体内连词或特殊字符的去偏预测,在长命名实体上展现出显著改进。此外,大多数 NER 数据集中存在严重的类别不平衡,导致诸如“The”这样的易负例在训练中占主导。我们的方法通过降低易负例的影响来缓解偏斜的类别分布。在生物医学和通用领域上的大量实验证明了我们方法的泛化能力。为促进可复现性与未来工作,我们发布了代码:https://github.com/minstar/RegLER。
引用
@article{arxiv.2104.07249,
title = {Regularization for Long Named Entity Recognition},
author = {Minbyul Jeong and Jaewoo Kang},
journal= {arXiv preprint arXiv:2104.07249},
year = {2022}
}