中文

数据集特征如何影响倾向得分方法与回归在观察性研究中控制混杂的性能?一项模拟研究

统计方法学 2022-10-21 v1

摘要

在观察性研究中,研究者必须选择一种控制混杂的方法。可选方法包括倾向得分方法和回归。目前尚不清楚数据集特征(样本量、倾向得分的重叠度、暴露患病率)如何影响这些方法的相对性能,这使得针对特定数据集选择最佳方法变得困难。我们进行了一项模拟研究,以评估在存在混杂的情况下,与 logistic 回归相比,数据集特征对倾向得分方法估计边际优势比性能的作用。结果由 logistic 和互补双对数模型模拟生成,并改变样本量、倾向得分重叠度和暴露患病率。回归在小样本量下覆盖概率较差,但在大样本量下比倾向得分方法对倾向得分不平衡和低暴露患病率更具鲁棒性。倾向得分方法频繁表现出次优覆盖,尤其在倾向得分重叠度降低时。这些问题在较大样本量下加剧。匹配方法的功效尤其受到重叠度缺乏、低暴露患病率和较小样本量的影响。逆概率加权处理的性能严重依赖于数据集特征,在低重叠度下覆盖概率和偏倚均较差。在采用互补双对数结果生成机制及未测量混杂的敏感性分析中,回归对于大数据量的优势不太明确,其偏倚和误差优于最近邻和卡尺匹配,但覆盖概率低于后者。

关键词

引用

@article{arxiv.2203.13067,
  title  = {How do dataset characteristics affect the performance of propensity score methods and regression for controlling confounding in observational studies? A simulation study},
  author = {J. Wilkinson and M. A. Mamas and E. Kontopantelis},
  journal= {arXiv preprint arXiv:2203.13067},
  year   = {2022}
}