中文

面向结构化临床数据的机器学习

机器学习 2017-07-25 v1

摘要

在电子健康记录(EHR)中,研究是第三优先级,其首要优先级是患者护理和计费。因此,数据并未以易于适应机器学习方法的方式进行标准化或格式化。由于从个人输入习惯到临床决策差异(例如开具哪些化验项目)等各种各样的原因,数据可能会出现缺失。很少有患者被以研究质量进行标注,这限制了样本量并导致金标准不断变化。患者随时间的病情演变对于理解许多疾病至关重要,但许多机器学习算法需要在单一时间点获取快照,以创建可用的向量形式。此外,产生黑盒结果的算法无法提供临床应用所需的可解释性。本章讨论了在将机器学习技术应用于结构化 EHR(即患者人口统计学特征、家族史、用药信息、生命体征、化验检查、基因检测)时所面临的这些挑战及其他问题。它不涵盖从影像数据或自由文本患者病历等额外来源进行特征提取,但所讨论的方法可以包含从这些来源提取的特征。

关键词

引用

@article{arxiv.1707.06997,
  title  = {Machine Learning for Structured Clinical Data},
  author = {Brett K. Beaulieu-Jones},
  journal= {arXiv preprint arXiv:1707.06997},
  year   = {2017}
}