基于临床笔记的患者表示学习及可解释性评估
计算与语言
2018-07-05 v1 机器学习
摘要
我们在本工作中作出三点贡献:1. 我们探索使用堆叠去噪自编码器与段落向量模型,直接从临床笔记中学习任务无关的稠密患者表示。为分析这些表示是否可跨任务迁移,我们在多种监督设定下评估它们以预测患者死亡率、主要诊断与操作类别以及性别。我们将其性能与从词袋模型获得的稀疏表示进行比较。我们观察到,当可用于学习的正例较少且缺乏强词汇特征时,所学到的泛化表示显著优于稀疏表示。2. 我们将由词袋构建的特征集与从医学概念获得的性能进行比较。在后一种情况下,概念表示问题、治疗和检测。我们发现概念识别并未提升分类性能。3. 我们提出新技术以促进模型可解释性。为理解并解释这些表示,我们探索从自编码器模型获得的患者表示中编码最好的特征。进一步,我们计算两个网络间的特征敏感度,以在使用这些预训练表示作为监督输入时,识别不同分类任务中最显著的输入特征。我们利用该技术成功提取了流程中最具影响力的特征。
引用
@article{arxiv.1807.01395,
title = {Patient representation learning and interpretable evaluation using clinical notes},
author = {Madhumita Sushil and Simon Šuster and Kim Luyckx and Walter Daelemans},
journal= {arXiv preprint arXiv:1807.01395},
year = {2018}
}
备注
Accepted manuscript at Journal of Biomedical Informatics