利用真实世界数据实现基于机器学习的表型的可扩展临床解释
机器学习
2022-08-03 v1 信息检索
摘要
大规模且深度的电子健康记录(EHR)数据集的可用性,有潜力使我们更好地理解真实世界的患者历程,并识别新的患者亚组。基于 ML 的 EHR 数据聚合大多是工具驱动的,即构建于可用或新开发的方法之上。然而,这些方法、其输入要求,尤其是所得输出,往往难以解释,特别是在缺乏深入的数据科学或统计培训的情况下。这危及分析的最后一步,即需要可操作且具临床意义的解释。本研究探讨了使用大型 EHR 数据集和多种聚类方法在临床研究中大规模执行患者分层分析的方法。我们开发了若干工具以促进对无监督患者分层结果的临床评估与解释,即模式筛选、元聚类、替代建模与筛选整理。这些工具可用于分析的不同阶段。与标准分析方法相比,我们展示了压缩结果和优化分析时间的能力。在元聚类的案例中,我们证明在一个例子中患者簇的数量可从 72 减少到 3。在另一分层结果中,通过使用替代模型,我们快速识别出若具备血钠测量值,心力衰竭患者即被分层。由于这是对 all 心力衰竭患者进行的常规测量,这表明存在数据偏差。通过进一步的队列与特征筛选,这些患者及其他无关特征可被移除,以提升临床意义。这些例子显示了所提方法的有效性,我们希望鼓励该领域的进一步研究。
引用
@article{arxiv.2208.01607,
title = {Enabling scalable clinical interpretation of ML-based phenotypes using real world data},
author = {Owen Parsons and Nathan E Barlow and Janie Baxter and Karen Paraschin and Andrea Derix and Peter Hein and Robert Dürichen},
journal= {arXiv preprint arXiv:2208.01607},
year = {2022}
}
备注
27 pages, 14 figures