DFW:一种用于协变量平衡和处理效应估计的新型加权方案
机器学习
2025-08-08 v1 统计方法学
摘要
从观察数据估计因果效应因选择偏差而具有挑战性,这会导致不同处理组之间协变量分布不平衡。基于倾向得分的加权方法广泛用于通过重新加权样本来模拟随机对照试验 (RCT)。然而,这些方法的有效性很大程度上取决于观察数据和倾向得分估计器的准确性。例如,逆倾向加权 (IPW) 根据倾向得分的倒数分配权重,当倾向得分具有高方差时——无论是由于数据问题还是模型误指定性——会导致权重不稳定,从而损害处理效应估计和选择偏差处理的能力。为克服这些限制,我们提出解除混淆因子加权 (DFW),这是一种新颖的基于倾向得分的方法,利用解除混淆因子构建稳定且有效的样本权重。DFW 优先考虑较少受混淆的样本,同时减轻高度受混淆样本的影响,产生一个更贴近 RCT 的伪 populations。我们的 метод确保权重有界、方差较低,并实现更好的协变量平衡。虽然 DFW 针对二元处理,但它天然地扩展到多处理设置,因为解除混淆因子是基于每个样本实际接收的处理概率计算的。通过在真实世界基准数据集和合成数据集上的大量实验,我们展示了 DFW 在协变量平衡和处理效应估计方面优于现有方法,包括 IPW 和 CBPS。
引用
@article{arxiv.2508.05215,
title = {DFW: A Novel Weighting Scheme for Covariate Balancing and Treatment Effect Estimation},
author = {Ahmad Saeed Khan and Erik Schaffernicht and Johannes Andreas Stork},
journal= {arXiv preprint arXiv:2508.05215},
year = {2025}
}
备注
This paper has been accepted in Frontiers in Applied Mathematics and Statistics - Mathematics of Computation and Data Science