基于伪权重与调查校准的数据整合:应用于开发具美国代表性、用于筛查的肺癌风险模型
统计方法学
2023-10-26 v1
摘要
准确的癌症风险估计对临床决策至关重要,例如识别高危人群进行筛查。然而,大多数现有癌症风险模型纳入了流行病学研究数据,通常无法代表目标人群。尽管基于人群的健康调查适于对目标人群推断,但通常不收集癌症发病时间数据。相反,通过关联生命统计,调查中常易获得癌症特异性死亡时间数据。我们开发了校准伪权重方法,整合来自队列和调查的个体层面数据,以及国家癌症登记处的癌症发病汇总统计量。通过利用调查中的个体层面癌症死亡数据,所提方法对调查样本个体的癌症发病时间进行插补,并使用由 Cox 回归生成的影响函数辅助变量进行调查校准,以提升逆倾向伪权重方法在估计纯粹风险时的稳健性与效率。我们利用所提方法,整合国家健康访谈调查(NHIS)与癌症登记处数据,从前列腺、肺、结直肠和卵巢(PLCO)癌症筛查试验中开发了肺癌发病纯粹风险模型。
引用
@article{arxiv.2310.16650,
title = {Data-integration with pseudoweights and survey-calibration: application to developing US-representative lung cancer risk models for use in screening},
author = {Lingxiao Wang and Yan Li and Barry Graubard and Hormuzd Katki},
journal= {arXiv preprint arXiv:2310.16650},
year = {2023}
}