面向近似用户体验的医学实体识别系统广泛错误分析与基于学习的评估
计算与语言
2020-06-11 v1 机器学习
摘要
当将医学实体识别系统提取的实体与测试集上的金标准标注进行比较时,可能出现两类不匹配:标签不匹配或跨度不匹配。本文我们关注跨度不匹配,并表明由于其跨度标注的主观性,其严重程度可从严重错误到完全可接受的实体提取不等。对于一个特定领域的基于 BERT 的 NER 系统,我们表明 25% 的错误与金标准实体具有相同的标签和重叠跨度。我们收集的专家判断显示,这些不匹配中超过 90% 被用户接受或部分接受。利用该 NER 系统的训练集,我们构建了一个快速轻量的实体分类器,通过接受或拒绝这些不匹配来近似用户体验。该分类器所做的决策用于计算基于学习的 F 值,其被证明比松弛 F 值更能近似宽容用户的体验。我们展示了将所提评估指标应用于用两个数据集训练的各种深度学习医学实体识别模型的结果。
引用
@article{arxiv.2006.05281,
title = {Extensive Error Analysis and a Learning-Based Evaluation of Medical Entity Recognition Systems to Approximate User Experience},
author = {Isar Nejadgholi and Kathleen C. Fraser and Berry De Bruijn},
journal= {arXiv preprint arXiv:2006.05281},
year = {2020}
}
备注
to appear at BioNLP2020