面向大规模电子健康记录数据中纵向轨迹的多平台 K 均值聚类算法——clustra
统计计算
2025-07-02 v1 应用统计
摘要
背景与目标:随时间收集的变量(如电子健康记录数据中的生物学测量值)无法用单个时间点来概括,因此可以更全面地概念化为随时间的轨迹。纵向数据聚类分析允许对具有相似轨迹的受试者群体进行临床表示,并识别唯一特征或表型,以用作风险因子或疾病结局的探索对象。估计这些聚类轨迹的挑战包括:处理在不一致时间间隔上的观察值,以及跨编程语言的算法可用性。方法:我们提出使用薄板样条回归的 K 均值聚类进行纵向轨迹聚类,实现跨多个平台的 R 包 clustra 和相应的 SAS 宏。SAS 宏支持灵活的聚类方法,并包括聚类可视化以及用于诊断评估合适聚类数的 Silhouette 图。R 包在平行于设计中具有类似功能,额外支持多核处理和基于 Rand 指数的诊断。结果:该软件包和宏在应用于基于来自接受抗高血压药物治疗的美国 Veterans Affairs 健康保健接收者的模拟血压测量数据时,能够实现可比的结果。结论:R 包 clustra 和 SAS 宏将 K 均值聚类算法集成到用于纵向轨迹的聚类中,可处理大型电子健康记录数据。这些实现在两个平台上提供可比的结果,满足熟悉或受限于一个或另一个平台的研究者的需求。
引用
@article{arxiv.2507.00962,
title = {clustra: A multi-platform k-means clustering algorithm for analysis of longitudinal trajectories in large electronic health records data},
author = {Nimish Adhikari and Hanna Gerlovin and George Ostrouchov and Rachel Ehrbar and Alyssa B. Dufour and Brian R. Ferolito and Serkalem Demissie and Lauren Costa and Yuk-Lam Ho and Laura Tarko and Edmon Begoli and Kelly Cho and David R. Gagnon},
journal= {arXiv preprint arXiv:2507.00962},
year = {2025}
}
备注
15 pages, 11 figures, clustra package available in https://cran.r-project.org/web/packages/clustra/index.html, SAS macros available in https://github.com/MVP-CHAMPION/clustra-SAS