CrossWeigh:从含错标注中训练命名实体标注器
计算与语言
2019-09-05 v1
摘要
人皆有过,人工标注者在构建命名实体识别(NER)标签时亦如此。此类标注错误可能损害模型训练并干扰模型比较。本研究中,我们深入考察广泛采用的NER基准数据集CoNLL03 NER。我们识别出约5.38%测试句子中的标注错误,考虑到当前最优测试F1分数已约93%,这是一个显著比例。因此,我们手动修正这些标注错误并形成更干净的测试集。相较于原测试集,在此修正测试集上重新评估流行模型可得出更准确的评价。更重要的是,我们提出一个简单而有效的框架CrossWeigh,以处理NER模型训练中的标注错误。具体而言,它将训练数据划分为若干折并训练独立NER模型以识别每折中的潜在错误,随后相应调整训练数据权重以训练最终NER模型。大量实验证明,在三个数据集上将多种NER模型接入我们所提框架均有显著提升。所有实现与修正测试集见于我们的Github仓库:https://github.com/ZihanWangKi/CrossWeigh。
引用
@article{arxiv.1909.01441,
title = {CrossWeigh: Training Named Entity Tagger from Imperfect Annotations},
author = {Zihan Wang and Jingbo Shang and Liyuan Liu and Lihao Lu and Jiacheng Liu and Jiawei Han},
journal= {arXiv preprint arXiv:1909.01441},
year = {2019}
}