在随机试验中通过机器学习优化精度与功效:以 COVID-19 为应用案例
统计方法学
2021-09-10 v1 统计理论
统计理论
摘要
快速发现有效疗法要求在临床试验中高效利用可用资源。使用协变量调整可以获得精度更高的统计估计,从而减少得出无效或有效结论所需的参与者数量。我们关注生存数据和有序结局。在随机研究中,协变量调整的一个关键问题是:如何拟合一个关联结局与基线协变量的模型以最大化精度。我们提出了一项新的理论结果,在结局数据完全随机缺失的假设下,确立了多种依赖机器学习(如 l1-正则化、随机森林、XGBoost 和多元自适应回归样条)的协变量调整估计量的渐近正态性条件。我们进一步提出了渐近方差的一个一致估计量。重要的是,这些条件不要求机器学习方法收敛到给定基线变量下真实的结局分布,只要它们收敛到某个(可能不正确的)极限即可。我们开展了一项模拟研究,使用 Weill Cornell Medicine New York Presbyterian Hospital 超过 1500 名 COVID-19 住院患者的纵向数据,评估上述预测方法在 COVID-19 试验中的表现。我们发现,使用 l1-正则化得到的估计量及相应的假设检验能够控制第一类错误,并且在所有测试的样本量下均比未调整估计量更精确。我们还表明,当协变量对结局无预后作用时,即使在较小样本量(n = 100)下,l1-正则化仍与未调整估计量一样精确。我们提供了一个 R 包 adjrct,用于对有序结局和生存结局执行模型稳健的协变量调整。
引用
@article{arxiv.2109.04294,
title = {Optimizing Precision and Power by Machine Learning in Randomized Trials, with an Application to COVID-19},
author = {Nicholas Williams and Michael Rosenblum and Iván Díaz},
journal= {arXiv preprint arXiv:2109.04294},
year = {2021}
}