面向临床预测模型的抽样大小计算:基于 Fisher 信息分解——第 1 部分:二分类结果
统计方法学
2025-01-27 v2
摘要
在开发临床预测模型时,开发数据集的样本大小是关键考虑因素。小样本大小会引发过拟合、不稳定、性能差以及缺乏公平性的顾虑。以往研究已阐明了最小样本大小计算,以最小化过拟合并精确估计整体风险。然而即使满足这些标准,个体风险估计的不确定性(不稳定性)仍可能相当大。本文提出如何检查和计算开发具有可接受精度的个体风险估计所需的样本大小,以为决策提供信息并提高公平性。我们概述了一个在数据收集前或现有数据集可用时使用的五步流程。该方法要求研究人员指定目标人群中的整体风险、关键预测变量的(预期)分布,以及一个假设的“核心模型”,该模型可直接指定(即提供逻辑回归方程)或基于指定的 C 统计量和(标准化)预测变量的相对效应指定。我们产生闭式解,将个体风险估计的方差分解为 Fisher 单位信息矩阵、预测变量值和总样本量;这允许研究人员快速计算和检查指定样本量下的个体水平不确定性区间宽度和分类不稳定性。将此类信息呈现给关键利益相关者(如医务人员、患者、资助方),例如使用预测和分类不稳定性图有助于识别(目标)所需的样本量,以提高个体预测的信任、可靠性和公平性。我们的方案在软件模块 pmstabilityss 中实现。我们提供真实案例并强调临床背景的重要性,包括任何风险阈值用于决策。
引用
@article{arxiv.2407.09293,
title = {A decomposition of Fisher's information to inform sample size for developing fair and precise clinical prediction models -- part 1: binary outcomes},
author = {Richard D Riley and Gary S Collins and Rebecca Whittle and Lucinda Archer and Kym IE Snell and Paula Dhiman and Laura Kirton and Amardeep Legha and Xiaoxuan Liu and Alastair Denniston and Frank E Harrell and Laure Wynants and Glen P Martin and Joie Ensor},
journal= {arXiv preprint arXiv:2407.09293},
year = {2025}
}
备注
36 pages, 6 figures, 1 table