突变命名实体识别中单一与多重标注的对比研究
计算与语言
2021-01-20 v1
摘要
本文的重点是通过分析构建人工标注数据的不同方法,解决突变命名实体识别 (NER) 中的知识获取瓶颈。我们首先探讨使用单一标注者对比两名标注者的影响,以衡量是否需要多名标注者。在评估使用单一标注者的性能损失后,我们应用不同的方法对训练数据进行二次标注采样,旨在不要求完整遍标的情况下提升数据集质量。我们使用留出双标注数据构建了两个具有不同类型排序的场景:基于相似度的和基于置信度的。我们在以下两方面评估两种方法:(i) 它们识别错误训练实例(单一标注者标签与讨论后双标注不一致的情况)的能力,以及 (ii) 在将修正集成至不同阈值后,最先进分类器在突变 NER 上的性能。
引用
@article{arxiv.2101.07450,
title = {Single versus Multiple Annotation for Named Entity Recognition of Mutations},
author = {David Martinez Iraola and Antonio Jimeno Yepes},
journal= {arXiv preprint arXiv:2101.07450},
year = {2021}
}