面向调查数据的多级校准加权
统计方法学
2021-11-15 v2
摘要
在2016年11月的美国总统大选中,许多州级民意调查(尤其是上中西部地区)错误地预测了获胜候选人。对此 polling 失误的一个主要解释是:传统 polling 响应率的急剧下降导致更大程度依赖统计方法来调整相应偏差——而这些方法未能针对教育、种族与地理区域等关键变量之间的重要交互作用进行调整。利用传统调查方法寻找能解释重要交互作用的校准权重仍然具有挑战性:rake 通常仅平衡边际,而能精确平衡所有交互作用的事后分层仅对少量变量可行。本文提出多级校准加权,其对边际平衡施加严格约束,对高阶交互作用施加较宽松约束。这融合了事后分层的若干优势,同时保留 rake 的保证。随后我们通过灵活的结果模型修正由宽松约束引起的偏差;我们称此方法为带事后分层的双重回归(DRP)。我们刻画了这些估计量的渐近性质,并表明所提出的校准方法具有作为调查响应多层模型的双重表示。我们利用这些工具重新评估了2016年美国总统大选的大规模选民意向调查,发现所提方法带来了有意义的增益。该方法已在 multical R 包中提供。
引用
@article{arxiv.2102.09052,
title = {Multilevel calibration weighting for survey data},
author = {Eli Ben-Michael and Avi Feller and Erin Hartman},
journal= {arXiv preprint arXiv:2102.09052},
year = {2021}
}