一种深度表示赋能的远监督范式用于临床信息抽取
信息检索
2018-04-24 v1
摘要
目的:自动创建大规模标注训练数据集,并减少训练准确机器学习模型用于临床信息抽取的特征工程工作量。材料与方法:我们提出一种由深度表示赋能的远监督范式,用于从临床文本中抽取信息。在该范式中,基于规则的 NLP 算法被用于生成弱标签并自动创建大规模训练数据集。此外,我们使用预训练词嵌入作为深度表示,以消除机器学习对特定任务特征工程的需求。我们在两项临床信息抽取任务上评估了所提范式的有效性:吸烟状态抽取与股骨近端(髋部)骨折抽取。我们测试了三种流行的机器学习模型,即卷积神经网络(CNN)、支持向量机(SVM)与随机森林(RF)。结果:结果表明 CNN 最契合所提远监督范式。在大规模数据集下,它通过捕获额外的抽取模式优于基于规则的 NLP 算法。我们也验证了范式中词嵌入特征表示相对于词频-逆文档频率(tf-idf)与主题建模表示的优势。讨论:在临床领域,标注数据量有限始终是应用机器学习的瓶颈。此外,机器学习方法的性能高度依赖于特定任务的特征工程。所提范式通过利用基于规则的 NLP 算法自动赋予弱标签,并使用词嵌入特征表示消除对特定任务特征工程的需求,可缓解这些问题。
引用
@article{arxiv.1804.07814,
title = {A Deep Representation Empowered Distant Supervision Paradigm for Clinical Information Extraction},
author = {Yanshan Wang and Sunghwan Sohn and Sijia Liu and Feichen Shen and Liwei Wang and Elizabeth J. Atkinson and Shreyasee Amin and Hongfang Liu},
journal= {arXiv preprint arXiv:1804.07814},
year = {2018}
}