RAILS:用于志愿者基准国家生物库的合成抽样权重 —— 以 All of Us 研究计划为案例研究
统计方法学
2025-01-17 v1
摘要
虽然国家生物库对于推动医学研究至关重要,但其非概率抽样设计限制了其对目标人群的代表性。本文提出了一种方法,利用高质量的国家调查数据创建用于非概率队列研究的合成抽样权重,以提高其代表性。具体而言,我们聚焦于推导更准确的基础权重,这有助于通过满足人口约束条件来实现校准,并自动化数据支持的交叉表选取校准。该方法结合了伪设计基准模型与一种新颖的后进先出准则,增强了估计的准确性和稳定性。大量仿真结果表明,我们称之为 RAILS 的方法可减少偏差、提高效率并加强推断力度。我们将该方法应用于 All of Us 研究计划,利用 2020 年国家健康调查计划和 2022 年美国人口普查局的调查数据,比较常见表型的患病率估计与国家基准之间的差异。结果凸显了该方法有效减少非概率样本选择偏差的能力,为增强生物库的代表性提供了有价值的工具。通过为 All of Us 研究计划开发的抽样权重,我们可以估计美国人口中未被国家概率调查捕获的表型和基因型的患病率。
引用
@article{arxiv.2501.09115,
title = {RAILS: A Synthetic Sampling Weights for Volunteer-Based National Biobanks -- A Case Study with the All of Us Research Program},
author = {Huiding Chen and Andrew Guide and Lina Sulieman and Robert M Cronin and Thomas Lumley and Qingxia Chen},
journal= {arXiv preprint arXiv:2501.09115},
year = {2025}
}
备注
36 pages, 2 figure2, 4 tables