用于开发临床预测模型的样本量计算:概述与 pmsims R 软件包
数学物理
2026-03-02 v1 math.MP
摘要
背景:临床预测模型日益用于指导医疗决策,但确定其开发的最小样本量仍是一个关键且尚未解决的挑战。样本量不足可能导致过拟合、泛化性差和预测偏差。现有方法,如经验法则、闭式公式和基于仿真的方法,在灵活性和准确性方面存在差异,尤其是针对复杂数据结构和机器学习模型。方法:我们审述了预测建模中用于样本量估计的当前方法,提出了一种概念框架,将基于均值的标准与基于保证的标准区分开来。基于此,我们提出一种新颖的基于仿真的方法,集成学习曲线、高斯过程优化和保证原则,以识别实现目标性能的样本量。该方法在 pmsims—an 开源、模型中性 R 软件包中实现。结果:通过案例研究,我们展示样本量估计在不同方法、绩效指标和建模策略下差异很大。与现有工具相比,pmsims 提供了灵活、高效且可解释的解决方案,能够适应多样化的模型和用户自定义指标,同时显式地考虑模型绩效的变异性。结论:我们的框架和软件推进了临床预测建模的样本量方法,通过灵活性与计算效率的结合实现。未来工作应将这些方法扩展到分层数据和多模态数据,纳入公平性和稳定性指标,并解决诸如缺失数据和复杂依赖结构等挑战。
引用
@article{arxiv.2602.23506,
title = {Dispersionless Hirota system and hidden symmetries of heavenly equation},
author = {Andriy Panasyuk and Adam Szereszewski},
journal= {arXiv preprint arXiv:2602.23506},
year = {2026}
}
备注
29 pages