中文

风险预测模型开发中样本信息的预期价值计算

统计方法学 2025-06-03 v2

摘要

风险预测模型常被描述为将协变量映射到预测风险的确定性函数。然而,它们通常使用有限样本进行训练,因而其预测本质上具有不确定性。这种不确定性已通过对模型性能指标(例如围绕c统计量的置信区间)以及预测的不确定性或不稳定性来处理。相应地,模型开发研究的样本量计算旨在提高摘要统计量估计的精度以及预测的稳定性。然而,在评估模型的临床效用时(例如在决策曲线分析中的净收益计算中),统计推断的相关性较小。从决策论的角度看,样本的有限大小导致因拟合模型与正确模型之间的差异而产生效用损失。从这一角度看,获取更多开发数据与获取模型使用效用的预期收益相关。本文我们将样本信息的预期价值(EVSI)定义为通过获取给定大小的额外开发样本,模型使用效用的预期收益,以净收益术语表示。我们提出一种基于bootstrap的算法用于EVSI计算,并在案例研究中演示了其可行性和面向有效性。我们得出结论,决策论指标可以补充经典推断方法,用于设计旨在开发风险预测模型的研究。

关键词

引用

@article{arxiv.2410.03096,
  title  = {Expected value of sample information calculations for risk prediction model development},
  author = {Abdollah Safari and Paul Gustafson and Mohsen Sadatsafavi},
  journal= {arXiv preprint arXiv:2410.03096},
  year   = {2025}
}