面向中文临床命名实体识别的成本-质量自适应主动学习
计算与语言
2020-08-31 v1
摘要
临床命名实体识别(CNER)旨在自动识别电子健康记录(EHRs)中的临床术语,是临床研究基础而关键的一步。为训练高性能的CNER模型,通常需要大量带高质量标注的EHRs。然而,标注EHRs尤其是中文EHRs耗时且昂贵。一种有效解决方案是主动学习,即模型请求标注者标注模型不确定的数据。传统主动学习假设单一标注者总是对查询标签给出无噪声回答。但在实际场景中,多个标注者提供不同质量的标注且成本各异,而整体标注质量较低的标注者仍可能对某些特定实例给出正确标签。本文提出一种面向中文EHRs中CNER的成本-质量自适应主动学习(CQAAL)方法,其在标注质量、标注成本与所选实例的信息量之间保持平衡。具体而言,CQAAL以自适应方式选择性价比高的实例-标注者配对,以更低成本实现更优标注质量。在CCKS-2017 Task 2基准数据集上的计算结果表明所提CQAAL的优越性与有效性。
引用
@article{arxiv.2008.12548,
title = {Cost-Quality Adaptive Active Learning for Chinese Clinical Named Entity Recognition},
author = {Tingting Cai and Yangming Zhou and Hong Zheng},
journal= {arXiv preprint arXiv:2008.12548},
year = {2020}
}
备注
8 pages, 2 figures