中文

通过代理变量高效建模改进多源高维生物样本库研究

统计方法学 2023-09-04 v2

摘要

由于图表审阅金标准标签的稀缺或缺失,电子健康记录(EHR)和生物样本库数据中的代理变量在生物医学研究中起着重要作用。我们开发了一种名为SASH的新方法,用于代理辅助和数据屏蔽的高维整合回归。它是一种半监督方法,高效利用来自多个本地站点的带有易错EHR代理结果的大量未标记样本,以提高少量金标签数据的学习准确性。为了从代理变量中稳定高效地提取知识,我们的方法首先获得一个初步的监督估计器,然后利用它辅助训练代理变量的正则化单指标模型(SIM)。有趣的是,通过一系列凸的且适当惩罚的稀疏回归来近似带偏差校正的SIM损失,我们的方法避免了SIM训练的局部极小问题,并完全消除了初步估计器大误差的影响。此外,它通过对本地站点间基于汇总统计的数据聚合,利用类似的SIM偏差校正近似思想,保护个体层面信息。通过模拟研究,我们证明了我们的方法在有限样本上优于现有方法。最后,我们将方法应用于利用来自UK和Mass General Brigham生物样本库的大规模数据集开发II型糖尿病的高维遗传风险模型,其中仅一个站点的小部分受试者通过图表审阅被标记。

关键词

引用

@article{arxiv.2302.04970,
  title  = {Efficient Modeling of Surrogates to Improve Multi-source High-dimensional Biobank Studies},
  author = {Yue Liu and Molei Liu and Zijian Guo and Tianxi Cai},
  journal= {arXiv preprint arXiv:2302.04970},
  year   = {2023}
}