中文

基于临床笔记语言模型预训练的改进型层次化患者分类

机器学习 2019-11-18 v3 计算与语言 机器学习

摘要

电子健康记录中的临床笔记包含高度异质的写作风格,包括非标准术语或缩写。在预测建模中使用这些笔记通常需要预处理(例如提取高频词或进行主题建模),这会去除源数据中的大量丰富信息。我们提出了一种预训练的层次化循环神经网络模型,该模型以直观的方式解析经过最低限度处理的临床笔记,并在MIMIC-III(重症监护医疗信息集市III)数据集上证明,与将笔记视为无序词集合或未进行预训练的模型相比,该模型提高了出院诊断分类任务的性能。我们还对示例应用了一种归因技术,以识别模型用于进行预测的词语,并展示了词语邻近上下文的重要性。

关键词

引用

@article{arxiv.1909.03039,
  title  = {Improved Hierarchical Patient Classification with Language Model Pretraining over Clinical Notes},
  author = {Jonas Kemp and Alvin Rajkomar and Andrew M. Dai},
  journal= {arXiv preprint arXiv:1909.03039},
  year   = {2019}
}

备注

Machine Learning for Health (ML4H) at NeurIPS 2019 - extended abstract