通过从REFLUX试验中恢复实验基准来比较统计调整方法的性能
应用统计
2020-01-23 v1
摘要
比较效果研究中的大量证据基于观察性研究。开展观察性研究的研究者通常假设处理组与对照组之间不存在不可观测的差异。在处理组与对照组的观测差异得到调整后估计处理效应。然而,由于模型设定错误,处理效应估计可能存在偏倚。即,若处理效应估计方法施加了过强的函数形式假设,处理效应估计可能出现显著偏倚。在本研究中,我们比较了多种处理效应估计方法的性能。我们在来自英国的REFLUX研究背景下进行此比较。在REFLUX中,研究合格后,参与者被纳入随机试验臂或患者偏好臂。在随机试验中,患者被随机分配至手术或药物管理。在患者偏好臂中,参与者选择接受手术或药物管理。我们试图利用研究的患者偏好臂数据恢复随机试验臂的处理效应估计。我们改变处理效应估计方法并记录哪些方法成功、哪些未成功。我们应用了超过20种不同方法,包括标准回归模型以及先进机器学习方法。我们发现简单的倾向得分匹配方法表现最差。我们还发现不同方法间性能存在显著变异。性能的广泛变异表明分析人员应将多种估计方法作为稳健性检验使用。
引用
@article{arxiv.2001.08170,
title = {Comparing the Performance of Statistical Adjustment Methods By Recovering the Experimental Benchmark from the REFLUX Trial},
author = {Luke Keele and Stephen O'Neill and Richard Grieve},
journal= {arXiv preprint arXiv:2001.08170},
year = {2020}
}