基于矩阵与张量分解的无监督电子健康记录表型分析
机器学习
2023-10-18 v1 机器学习
摘要
计算表型分析允许从电子健康记录(EHR)中无监督地发现患者亚组以及相应的共现疾病。通常,EHR 数据包含人口统计学信息、诊断和实验室结果。发现(新颖)表型具有预后和治疗价值。向医疗从业者提供透明且可解释的结果是一项重要要求,也是推进精准医疗的关键环节。低秩数据近似方法,如矩阵(例如非负矩阵分解)和张量分解(例如 CANDECOMP/PARAFAC)已证明能够提供此类透明且可解释的洞见。近期进展通过引入不同约束与正则化来改进低秩数据近似方法,以进一步增强可解释性。此外,它们为 EHR 数据中的常见挑战(如高维、数据稀疏与不完整)提供了解决方案。尤其是从纵向 EHR 中提取时间表型近年来备受关注。本文对基于低秩近似的计算表型分析方法进行了全面综述。现有文献按基于矩阵与张量分解的时间 vs. 静态表型分析方法进行分类。此外,我们概述了表型验证的不同方法,即临床意义的评估。
引用
@article{arxiv.2209.00322,
title = {Unsupervised EHR-based Phenotyping via Matrix and Tensor Decompositions},
author = {Florian Becker and Age K. Smilde and Evrim Acar},
journal= {arXiv preprint arXiv:2209.00322},
year = {2023}
}
备注
28 pages, 5 figures