同伴效应观察性研究中的偏差与高维调整
统计方法学
2021-02-16 v1 社会与信息网络
应用统计
机器学习
摘要
个体行为受同伴行为影响的同伴效应,被社会科学中的多种理论所假设。其他过程也可能在网络和群体中产生行为相关性,从而引发关于同伴效应观察性(即非实验性)研究可信度的争论。然而,识别同伴效应的随机化现场实验往往成本高昂或不可行。因此,许多同伴效应研究使用观察性数据,而此前对调整观察性数据以估计同伴效应的因果推断方法的评估,缺乏实验“金标准”作为比较。本文在 Facebook 信息与媒体扩散的背景下表明,使用倾向得分模型对非实验对照组(6.77 亿次观测)进行高维调整,所产生的同伴效应估计值与使用大规模随机实验(2.2 亿次观测)得到的估计值在统计上无法区分。朴素的观察性估计量将同伴效应高估了 320%,常用变量(如人口统计特征)几乎不减少偏差,但对与焦点行为密切相关的先前行为度量进行调整可将偏差减少 91%。对超过 3700 种过去行为进行调整的高维模型提供了额外的偏差减少,使得完整模型将偏差减少了 97% 以上。这项实验评估表明,详细的个体过去行为记录可以改进对社会影响、信息扩散和模仿的研究;这些结果对某些研究的可信度是令人鼓舞的,但对稀有或新行为的研究也具有警示意义。更一般地,这些结果展示了如何利用大型高维数据集和统计学习技术来改进行为科学中的因果推断。
引用
@article{arxiv.1706.04692,
title = {Bias and high-dimensional adjustment in observational studies of peer effects},
author = {Dean Eckles and Eytan Bakshy},
journal= {arXiv preprint arXiv:1706.04692},
year = {2021}
}
备注
25 pages, 3 figures, 2 tables; supplementary information as ancillary file