中文

NE-LP:基于归一化熵与损失预测的主动学习采样方法用于电子健康记录中文分词

计算与语言 2020-07-20 v3

摘要

医院信息系统中的电子健康记录(EHRs)包含患者的诊断和治疗信息,因此 EHRs 对临床数据挖掘至关重要。在挖掘过程的所有任务中,中文分词(CWS)是一项基础且重要的任务,而大多数最先进的方法极大地依赖于大规模人工标注数据。由于标注耗时且昂贵,研究者们致力于诸如主动学习等技术,以定位最具信息量的样本用于建模。本文顺应这一趋势,提出了一种用于 EHRs 中文分词的主动学习方法。具体而言,我们提出了一种结合归一化熵与损失预测(NE-LP)的新采样策略,以选择最具代表性的数据。同时,为最小化学习的计算成本,我们提出了一个包含分词器和损失预测模型的联合模型。此外,为捕捉相邻字符间的交互,联合模型中还应用了二元特征。为说明 NE-LP 的有效性,我们在上海中医药大学附属曙光医院收集的 EHRs 上进行了实验。结果表明,在中文分词的主动学习中,NE-LP 持续优于传统的基于不确定性的采样策略。

关键词

引用

@article{arxiv.1908.08419,
  title  = {NE-LP: Normalized Entropy and Loss Prediction based Sampling for Active Learning in Chinese Word Segmentation on EHRs},
  author = {Tingting Cai and Zhiyuan Ma and Hong Zheng and Yangming Zhou},
  journal= {arXiv preprint arXiv:1908.08419},
  year   = {2020}
}

备注

submitted to Neural Computing and Applications