中文

多位点可预测性曲线及其整体评估:用于遗传风险预测

统计方法学 2025-04-02 v1 人工智能 机器学习

摘要

随着高通量基因分型和测序技术的发展,越来越可行对大量遗传预测因子在疾病预测中的综合作用进行评估。因此,迫切需要开发适当的统计量来衡量这些遗传变异在疾病预测中的综合效应。可预测性曲线通常用作衡量风险预测模型在单个连续生物标志物上的预测能力的图形工具。然而,对于大多数复杂疾病,风险预测模型是基于多个遗传变异构建的。因此,我们提出了多标记可预测性曲线,并提供一种用于病例对照研究的非参数方法来构建该曲线。我们进一步引入了全局可预测性 U 统计量和局部可预测性 U 统计量,分别用于总结整个人群和临床感兴趣子群体上的预测曲线。我们还展示了可预测性曲线与 ROC 曲线和 Lorenz 曲线之间的关系。通过仿真,我们比较了可预测性 U 与其他三个摘要指标(R 平方、总收益和平均熵)的性能,结果表明在无偏性和鲁棒性方面,可预测性 U 在其他三个指标之上。此外,我们模拟了一系列罕见病变疾病模型,发现局部可预测性 U 在全域可预测性 U 之上。最后,我们进行了实际数据分析,使用可预测性曲线和可预测性 U 对尼古丁依赖风险预测模型的预测能力进行评估。

关键词

引用

@article{arxiv.2504.00024,
  title  = {A multi-locus predictiveness curve and its summary assessment for genetic risk prediction},
  author = {Changshuai Wei and Ming Li and Yalu Wen and Chengyin Ye and Qing Lu},
  journal= {arXiv preprint arXiv:2504.00024},
  year   = {2025}
}