利用多源 EHR 数据的结构化集体矩阵分解进行表型分析
应用统计
2016-09-16 v1
摘要
电子健康记录(EHR)的日益普及推动了利用数据驱动方法进行精准医学的倡议。这一工作的关键在于能够通过对 EHR 的简单查询来识别患有特定感兴趣疾病的患者,即基于 EHR 的表型。现有的基于规则的表型分析方法极其耗费人力。相反,机器学习中的降维和潜在因子估计技术可以在无(或最小)人工监督下用于表型提取。我们提出识别一个在各种 EHR 数据源间共享的、易于解释的潜在空间,作为表型的潜在候选。通过将异构数据类型中可用的多种 EHR 数据源(如诊断、药物和实验室报告)纳入广义的集体矩阵分解(CMF),我们的方法可以生成丰富的表型。此外,表型应用中的易解释性要求候选表型具有稀疏表示,例如,从患者药物和诊断数据导出的每个表型最好由少数诊断和药物(-- 个活跃成分)表示。我们提出了一种受约束的 CMF 公式来估计稀疏表型。我们通过在 Vanderbilt 大学医学中心的 EHR 数据上进行广泛的实证研究,证明了我们模型的有效性。
引用
@article{arxiv.1609.04466,
title = {Phenotyping using Structured Collective Matrix Factorization of Multi--source EHR Data},
author = {Suriya Gunasekar and Joyce C. Ho and Joydeep Ghosh and Stephanie Kreml and Abel N Kho and Joshua C Denny and Bradley A Malin and Jimeng Sun},
journal= {arXiv preprint arXiv:1609.04466},
year = {2016}
}