仅知均值、协方差和样本量时联邦数据的线性混合建模
统计方法学
2025-01-24 v1
摘要
在医学研究中,个体层面的患者数据提供了宝贵的信息,但患者的保密权仍然是重中之重。当估计统计模型(例如线性混合模型)时,这构成了巨大挑战。线性混合模型是线性回归模型的扩展,可以解释来自不同数据提供者的数据可能存在的异质性。联邦学习算法通过在不检索个体层面数据的情况下估计参数来解决这一障碍。相反,它需要在数据提供者和分析师之间迭代通信参数估计更新。在本文中,我们提出了一种替代联邦学习算法来拟合线性混合模型的框架。具体来说,我们的方法只需要来自不同数据提供者的多个协变量的均值、协方差和样本量一次。利用似然框架内的统计充分性原理作为理论支持,该提出的框架实现了与从实际个体层面数据得出的估计相同的估计。我们通过来自宾夕法尼亚州儿童医院(CHOP)70个诊所的15 068份患者记录的真实数据来演示这种方法。假设每个诊所仅共享一次汇总统计量,我们将COVID-19 PCR检测循环阈值建模为患者信息的函数。简单性、通信效率以及在任何统计软件中更广泛的实施范围,使我们的方法有别于文献中的现有策略。
引用
@article{arxiv.2407.20796,
title = {Linear mixed modelling of federated data when only the mean, covariance, and sample size are available},
author = {Marie Analiz April Limpoco and Christel Faes and Niel Hens},
journal= {arXiv preprint arXiv:2407.20796},
year = {2025}
}