中文

基于随机临床试验数据的个体化治疗效应机器学习模型评估

定量方法 2026-02-03 v2

摘要

目标:在随机临床试验中,预测模型可用于探讨患者变量(如临床、病理或生活方式变量,以及生物标志物或基因组数据)与治疗效应大小之间的关系。我们的目标是评估能够纳入高维数据中交互作用和非线性效应的灵活机器学习模型,以在具有时间-事件结果的试验中估计个体化治疗建议。方法:我们将基于神经网络的生存模型(CoxCC 和 CoxTime)和随机生存森林(Interaction Forests)与以自适应 LASSO(ALASSO)惩罚作为基准的比例风险模型进行比较。对于随机生存情境下的个体化治疗建议,我们将原为二分类结果设计的指标适应以容纳带有 censoring 的时间-事件数据。这些适应的指标包括 C-for-Benefit、E50-for-Benefit 以及治疗效益的均方根误差。我们进行了使用两种不同数据生成过程进行的广泛模拟研究,这两种过程都包含非线性和交互作用。所应用的模型是来自三组癌症临床试验数据集中的基因表达和临床数据。结果:在第一种数据生成过程中,神经网络在校准方面优于 ALASSO,而 Interaction Forests 在 C-for-benefit 性能方面表现优越。在第二种数据生成过程中,两种机器学习方法在判别、校准和 RMSE 指标上均优于基准线性 ALASSO 方法。在癌症试验数据集中,机器学习方法通常优于 ALASSO,特别是 IF 在 C-for-benefit 方面,以及神经网络或 IF 用于处理治疗效应的校准措施。

关键词

引用

@article{arxiv.2506.12277,
  title  = {Evaluation of machine-learning models to measure individualized treatment effects from randomized clinical trial data with time-to-event outcomes},
  author = {Elvire Roblin and Paul-Henry Cournède and Stefan Michiels},
  journal= {arXiv preprint arXiv:2506.12277},
  year   = {2026}
}

备注

20 pages, 8 figures