从电子健康记录中挖掘 Ensemble Deep Clustering 的有效性
机器学习
2026-04-09 v1
摘要
在电子健康记录(EHR)中,对患者进行聚类并区分疾病亚型是阐明病理生理学并辅助临床决策的关键任务。然而,EHR 中的聚类仍基于传统方法,尤其是 K-means,仅在应用于自编码器学习的嵌入表示作为混合方法时取得有限成功。本文使用来自 All of Us Research Program 真实 EHR 数据的心力衰竭患者队列,检验传统方法、混合方法和深度学习方法的有效性。传统聚类方法表现稳健,因为深度学习方法专为图像聚类设计,与表格 EHR 数据的差异显著。为解决深度聚类不足,本文引入一种基于从多个嵌入维度聚合聚类分配的集成方法,避免依赖单一固定的嵌入空间。结合传统聚类构建 novel 集成框架,所提出的集成嵌入深度聚类在 14 种多样化聚类方法和多个患者队列中实现最佳总体性能排名。这篇论文凸显了 EHR 数据的生物学性别特定聚类的重要性,以及单一方法与传统与深度聚类方法结合的优势。
引用
@article{arxiv.2604.07085,
title = {Mining Electronic Health Records to Investigate Effectiveness of Ensemble Deep Clustering},
author = {Manar D. Samad and Yina Hou and Shrabani Ghosh},
journal= {arXiv preprint arXiv:2604.07085},
year = {2026}
}
备注
14th IEEE Conference on Healthcare Informatics