基于聚类的函数后选择推断及其在电子健康记录数据分析中的应用
统计方法学
2024-05-07 v1 应用统计
统计计算
摘要
在电子健康记录(EHR)分析中,根据数据模式对患者进行聚类对于发现疾病的新亚型至关重要。现有医学文献通常依赖经典假设检验方法来测试这些簇之间均值的差异。由于聚类算法引起的选择偏差,针对后聚类数据实施这些经典方法常常导致类型I误差膨胀。本文引入一种新的统计方法,用于在分析随时间收集的数据时校正这种偏差。我们的方法将经典选择推断方法从横断面数据扩展到纵向数据。我们提供了该方法的理论保证,并给出选择性类型I和类型II误差的上界。我们将方法应用于仿真数据和真实世界的急性肾损伤(AKI)EHR数据集,从而展示了该方法的优势。
引用
@article{arxiv.2405.03042,
title = {Functional Post-Clustering Selective Inference with Applications to EHR Data Analysis},
author = {Zihan Zhu and Xin Gai and Anru R. Zhang},
journal= {arXiv preprint arXiv:2405.03042},
year = {2024}
}