从无标注癌症临床笔记中无监督提取表型用于关联研究
机器学习
2019-05-06 v2 计算与语言
应用统计
机器学习
摘要
医疗服务提供者近期对电子健康记录(EHR)的采用引入了一个重要的数据来源,可在大型队列中提供关于患者表型的详尽且高度特异的洞察。这些数据集与机器学习和统计方法相结合,为研究与临床照护带来了新机遇。然而,许多方法要求患者表征为结构化格式,而EHR中的信息常锁在于为人工可读性设计的非结构化文本中。本工作中,我们开发了无需先验知识即可从大型EHR语料库的临床表现叙述中自动提取临床特征的方法。我们将临床表现叙述中出现的医学术语和句子视为原子信息单元。我们提出了一种适用于大型文本语料分析的高效聚类策略,并利用这些聚类来紧凑地表示患者信息。为展示我们方法的效用,我们对来自4,007名癌症患者及其肿瘤的体细胞突变谱与临床特征进行了关联研究。我们将所提算法应用于一个包含约6.5万份文档、总计约320万句子的数据集。我们识别出体细胞突变存在与临床特征之间的341个显著统计关联。我们根据新颖性对这些关联进行标注,并报告了若干已知关联。我们还提出了32个可检验的假设,其潜在生物学机制似乎未知但合理。这些结果表明,临床特征的自动发现是可行的,且临床与遗传数据集的联合分析能够生成引人关注的新假设。
引用
@article{arxiv.1904.12973,
title = {Unsupervised Extraction of Phenotypes from Cancer Clinical Notes for Association Studies},
author = {Stefan G. Stark and Stephanie L. Hyland and Melanie F. Pradier and Kjong Lehmann and Andreas Wicki and Fernando Perez Cruz and Julia E. Vogt and Gunnar Rätsch},
journal= {arXiv preprint arXiv:1904.12973},
year = {2019}
}