中文

基于大规模电子健康记录表征学习的半监督聚类

统计方法学 2025-05-28 v1 机器学习

摘要

电子健康记录(EHR)提供了丰富的真实世界数据,为个体化医疗提供洞察,包括疾病进程、治疗反应和患者结局。然而,其稀疏性、异构性和高维度使其难以建模,缺乏标准化的真实标签进一步使预测建模复杂化。为此,我们提出SCORE,一个半监督表征学习框架,通过患者嵌入捕获多域疾病轮廓。SCORE采用准泊松潜在因子混合(PALM)模型,结合预训练的代码嵌入来刻画编码化特征,提取有意义的患者表型和嵌入。为处理大规模数据的计算挑战,它引入一种混合期望最大化(EM)和高斯变分近似(GVA)算法,利用有限的标签数据来细化来自海量未标记样本的估计。我们理论上建立了该混合方法的收敛性,量化GVA误差,并推导SCORE在嵌入维度发散时的误差率。我们的分析表明,纳入未标记数据可提升准确性并降低标签稀缺性的敏感性。广泛的仿真实验确认SCORE在有限样本性能方面优于现有方法。最后,我们将SCORE应用于使用部分标记EHR数据预测多发性硬化(MS)患者残疾状态,证明其为MS相关疾病生成更具信息性和预测性的患者嵌入。

关键词

引用

@article{arxiv.2505.20731,
  title  = {Semi-supervised Clustering Through Representation Learning of Large-scale EHR Data},
  author = {Linshanshan Wang and Mengyan Li and Zongqi Xia and Molei Liu and Tianxi Cai},
  journal= {arXiv preprint arXiv:2505.20731},
  year   = {2025}
}