中文

词嵌入特征在临床信息抽取主动学习中的益处

计算与语言 2016-11-16 v4

摘要

本研究调查了在无监督词嵌入和序列特征用于样本表示,构建从临床自由文本中抽取临床概念的主动学习框架中。目标是进一步减少人工标注工作,同时相比一组基线特征实现更高效率。无监督特征源自skip-gram词嵌入和序列表示方法。在主动学习框架中,使用广泛的选择准则(包括最小置信度、信息多样性、信息密度与多样性、以及领域知识信息量)研究了无监督特征与基线手工特征的相对性能。使用两个临床数据集进行评估:i2b2/VA 2010 NLP挑战赛和ShARe/CLEF 2013 eHealth评估实验室。我们的结果表明,在两个数据集上效果和标注工作节省均有显著改进。使用无监督特征连同基线特征进行样本表示,进一步分别节省了高达9%和10%的token与概念标注率。

关键词

引用

@article{arxiv.1607.02810,
  title  = {The Benefits of Word Embeddings Features for Active Learning in Clinical Information Extraction},
  author = {Mahnoosh Kholghi and Lance De Vine and Laurianne Sitbon and Guido Zuccon and Anthony Nguyen},
  journal= {arXiv preprint arXiv:1607.02810},
  year   = {2016}
}