中文

汇总数据的自训练及其遗传应用

统计方法学 2025-03-18 v1 统计理论 应用统计 统计理论

摘要

预测模型训练常因隐私顾虑和后勤挑战而难以获取个体层面数据,尤其是在生物医学研究中。基于重采样的自训练为仅利用汇总级数据构建预测模型提供了一种有前景的方法。这些方法利用汇总统计量对伪数据集进行采样以进行模型训练和参数优化,从而无需个体层面数据即可进行模型开发。尽管在精准医学中日益广泛使用,但自训练的一般行为仍未被探索。在本文中,我们利用随机矩阵理论框架,为高维无稀疏性约束汇总数据的自训练算法建立统计性质。我们证明,在线性估计器类中,基于重采样的自训练达到与传统训练方法(需要个体层面数据集)相同的渐近预测精度。这些结果表明,仅使用汇总数据进行自训练在预测精度上没有额外成本,同时提供了显著的实用便利。我们的分析提供了若干有价值的见解和反直觉发现。例如,尽管伪训练和验证数据集本质上相互依赖,但这种相互依赖性在计算预测精度度量时意外地相互抵消,从而防止了自训练算法中的过拟合。此外,我们将分析扩展到表明自训练框架在组合多种方法或联合训练不同分布的数据时仍保持这种无成本优势。我们通过模拟和利用UK Biobank的真实数据分析数值验证了我们的发现。本研究突显了基于重采样的自训练在推进遗传风险预测及其他公开汇总数据领域的潜力。

关键词

引用

@article{arxiv.2503.12155,
  title  = {On self-training of summary data with genetic applications},
  author = {Buxin Su and Jiaoyang Huang and Jin Jin and Bingxin Zhao},
  journal= {arXiv preprint arXiv:2503.12155},
  year   = {2025}
}