通过代理变量高效建模改进多源高维生物样本库研究
统计方法学
2023-09-04 v2
摘要
由于图表审阅金标准标签的稀缺或缺失,电子健康记录(EHR)和生物样本库数据中的代理变量在生物医学研究中起着重要作用。我们开发了一种名为SASH的新方法,用于代理辅助和数据屏蔽的高维整合回归。它是一种半监督方法,高效利用来自多个本地站点的带有易错EHR代理结果的大量未标记样本,以提高少量金标签数据的学习准确性。为了从代理变量中稳定高效地提取知识,我们的方法首先获得一个初步的监督估计器,然后利用它辅助训练代理变量的正则化单指标模型(SIM)。有趣的是,通过一系列凸的且适当惩罚的稀疏回归来近似带偏差校正的SIM损失,我们的方法避免了SIM训练的局部极小问题,并完全消除了初步估计器大误差的影响。此外,它通过对本地站点间基于汇总统计的数据聚合,利用类似的SIM偏差校正近似思想,保护个体层面信息。通过模拟研究,我们证明了我们的方法在有限样本上优于现有方法。最后,我们将方法应用于利用来自UK和Mass General Brigham生物样本库的大规模数据集开发II型糖尿病的高维遗传风险模型,其中仅一个站点的小部分受试者通过图表审阅被标记。
引用
@article{arxiv.2302.04970,
title = {Efficient Modeling of Surrogates to Improve Multi-source High-dimensional Biobank Studies},
author = {Yue Liu and Molei Liu and Zijian Guo and Tianxi Cai},
journal= {arXiv preprint arXiv:2302.04970},
year = {2023}
}