中文

基于参考面板的正则化估计量的精确风险

统计方法学 2024-01-23 v1 统计理论 统计理论

摘要

基于参考面板的估计量因能够解决数据隐私问题并降低计算与通信成本,在复杂性状的遗传预测中得到了广泛应用。这类估计量使用外部参考面板来估计预测变量的协方差矩阵,而不是仅仅依赖原始训练数据。本文基于近似消息传递(AMP)框架,研究了基于参考面板的 L1L_1L2L_2 正则化估计量在统一框架下的性能。我们揭示了影响基于参考面板的估计量准确性的几个关键因素,包括训练数据和参考面板的样本量、信噪比、信号的潜在稀疏性以及预测变量之间的协方差矩阵。我们的研究结果表明,即使参考面板的样本量与训练数据相匹配,基于参考面板的估计量与传统正则化估计量相比,准确性往往也较低。此外,我们观察到,随着训练数据量的增加,这种性能差距会扩大,这凸显了构建大规模参考面板以缓解该问题的重要性。为了支持我们的理论分析,我们开发了一种新颖的不可分矩阵 AMP 框架,能够处理由一般协方差矩阵和参考面板带来的额外随机性所引入的复杂性。我们通过广泛的模拟研究以及使用 UK Biobank 数据库的真实数据分析验证了我们的理论结果。

关键词

引用

@article{arxiv.2401.11359,
  title  = {The Exact Risks of Reference Panel-based Regularized Estimators},
  author = {Buxin Su and Qiang Sun and Xiaochen Yang and Bingxin Zhao},
  journal= {arXiv preprint arXiv:2401.11359},
  year   = {2024}
}

备注

100 pages, 11 figures