中文

针对异质性缺失数据模式的前列腺癌风险预测适配方法

应用统计 2022-07-26 v1

摘要

目的:我们比较了六种常用的逻辑回归方法,用于适配来自多个异质队列的缺失风险因素数据,其中部分队列完全未收集某些风险因素,并开发了一种可适配终端用户缺失风险因素的在线风险预测工具。研究设计与设置:来自前列腺活检协作组(PBCG)的十个北美和欧洲队列被用于拟合针对有临床意义前列腺癌的风险预测工具,该疾病定义为标准 TRUS 前列腺活检中 Gleason 分级分组大于等于 2。一个大型欧洲 PBCG 队列被留作外部验证,评估了总体校准(CIL)、校准曲线和受试者工作特征曲线下面积(AUC)。十折留一队列内部验证进一步验证了最优缺失数据方法。结果:在来自 10 个训练队列的 12,703 例活检中,3,597 例(28%)患有有临床意义前列腺癌,而外部验证队列中 5,540 例里有 1,757 例(32%)。在外部验证中,汇总包含终端用户输入的所有风险因素的个体患者数据的可用病例法具有最佳 CIL,平均低估风险 2.9 个百分点,并获得 75.7% 的 AUC。插补法 CIL 最差(-13.3%)。可用病例法在内部交叉验证中进一步被验证为最优,因此用于开发在线风险工具。对于风险工具的终端用户,两个风险因素为必填:血清前列腺特异性抗原(PSA)和年龄,十个为选填:直肠指检、前列腺体积、既往阴性活检、5-α-还原酶抑制剂使用、既往 PSA 筛查、非洲裔血统、西班牙裔 ethnicity、一级亲属前列腺癌史、一级亲属乳腺癌史和二级亲属前列腺癌史。

关键词

引用

@article{arxiv.2109.10141,
  title  = {Accommodating heterogeneous missing data patterns for prostate cancer risk prediction},
  author = {Matthias Neumair and Michael W. Kattan and Stephen J. Freedland and Alexander Haese and Lourdes Guerrios-Rivera and Amanda M. De Hoedt and Michael A. Liss and Robin J. Leach and Stephen A. Boorjian and Matthew R. Cooperberg and Cedric Poyet and Karim Saba and Kathleen Herkommer and Valentin H. Meissner and Andrew J. Vickers and Donna P. Ankerst},
  journal= {arXiv preprint arXiv:2109.10141},
  year   = {2022}
}