高维遗传数据预测中基于分块与外部参考面板的估计量研究
统计方法学
2022-03-24 v1
摘要
复杂性状与疾病的遗传预测在精准医学中备受关注,主要因其有潜力将全基因组关联研究(GWAS)的发现转化为医学进展。由于遗传变异的高维协方差矩阵(或连锁不平衡(LD)模式)具有块对角结构,许多现有方法试图在预定的局部 LD 块/区域内考虑变异间的依赖性。此外,出于隐私限制与数据保护考量,各 LD 块内的遗传变异依赖性通常基于外部参考面板而非原始训练数据集估计。本文在高维预测框架下,无稀疏性限制地统一分析了基于分块与外部参考面板的估计量。我们惊讶地发现,即便协方差矩阵具有边界明确的块对角结构,调整局部依赖的分块估计方法在精度上可能明显逊于控制整体协方差矩阵的方法。进一步,基于原始训练数据集与外部参考面板建立的估计方法在高维下性能可能有别,这或反映了仅能获取训练数据集汇总水平数据所付出的代价。该分析基于我们在块对角协方差矩阵随机矩阵理论上的新结果。我们通过大量模拟及针对 36 个复杂性状的大规模 UK Biobank 真实数据分析,对结果作了数值评估。
引用
@article{arxiv.2203.12003,
title = {On block-wise and reference panel-based estimators for genetic data prediction in high dimensions},
author = {Bingxin Zhao and Shurong Zheng and Hongtu Zhu},
journal= {arXiv preprint arXiv:2203.12003},
year = {2022}
}
备注
27 pages, 5 figures