中文

利用少量干净样本改进在噪声数据上训练的命名实体识别器

计算与语言 2023-10-26 v1 人工智能 机器学习

摘要

为达到最先进的性能,仍需在大规模、高质量标注数据上训练 NER 模型,而积累此类资产既昂贵又耗时。相比之下,现实应用常通过众包借助非专家标注者、以及通过远程监督借助外部知识库,以获取海量低质量标注数据作为经济替代方案。然而,这些标注方法导致噪声标签,进而引起性能显著下降。因此,我们提出以一小部分干净样本为引导来对噪声 NER 数据进行去噪。除主 NER 模型外,我们训练一个判别器模型,并利用其输出重新校准样本权重。该判别器能够通过不同的判别提示检测跨度与类别错误。在公开众包与远程监督数据集上的结果表明,所提方法可借助小规模引导集持续提升性能。

关键词

引用

@article{arxiv.2310.16790,
  title  = {Improving a Named Entity Recognizer Trained on Noisy Data with a Few Clean Instances},
  author = {Zhendong Chu and Ruiyi Zhang and Tong Yu and Rajiv Jain and Vlad I Morariu and Jiuxiang Gu and Ani Nenkova},
  journal= {arXiv preprint arXiv:2310.16790},
  year   = {2023}
}

备注

14 pages