中文

关于在因果推断中整合结果差异较大的研究的警示故事

统计方法学 2025-05-19 v1 机器学习 计量经济学

摘要

数据整合方法日益增多,用于提高研究的效率和可推广性。然而,这些方法的一个关键限制是假设结果在跨数据集中保持一致——这一假设在实际中往往不成立。考虑以下阿片类成瘾症候群(OUD)研究:XBOT 试验和 POAT 研究,均评估了用于治疗 OUD 的药物对戒断症状严重程�的影响(并非任一试验的主要结果)。XBOT 测量戒断症状的主观阿片戒断量表,而 POAT 使用临床阿片戒断量表。我们分析了这样一种现实且具有挑战性的情境:结果在不同研究中差异较大,且Neither 项研究记录了两种结果类型。我们的论文研究了在结果差异较大的研究中整合是否以及何时会导致效率收益。我们引入了三个假设集合——具有不同强度——来关联两种结果。我们的理论和经验结果揭示了一条警示之路:只有在关联两种结果的最强假设下,整合才会提高渐近效率。然而,这一假设的误指定会导致偏误。相比之下,较温和的假设可能产生有限样本的效率收益,但这些收益随样本量的增加而消失。我们通过案例研究将 XBOT 和 POAT 数据集整合,以估计两种阿片类成瘾症候群药物对戒断症状的比较效应。通过系统性地变更关联 SOW 和 COW 量表的假设,我们展示了潜在的效率收益以及偏误风险。我们的结果强调了在融合具有不同结果措施的数据集时,需谨慎选择假设,为研究人员在现代数据整合中面对这一常见挑战提供了指导。

关键词

引用

@article{arxiv.2505.11014,
  title  = {A Cautionary Tale on Integrating Studies with Disparate Outcome Measures for Causal Inference},
  author = {Harsh Parikh and Trang Quynh Nguyen and Elizabeth A. Stuart and Kara E. Rudolph and Caleb H. Miles},
  journal= {arXiv preprint arXiv:2505.11014},
  year   = {2025}
}