高维场景下政策的上线后评估
机器学习
2025-01-03 v1 机器学习
应用统计
统计方法学
摘要
A/B 测试,也称为随机对照实验(RCT),是评估新政策、产品或决策影响的金标准。然而,这些测试在时间和资源方面可能具有高昂的成本,甚至会将用户、客户或其他测试主体(单位)暴露于次优选项之下。本文探讨了在单元数量极大的设置下,将受“合成控制”方法启发的替代方法应用于传统 A/B 测试的实际考虑事项,这种设置在现代应用中常见,例如电子商务和叫车平台,涉及数亿甚至数千万个单位。在这些场景中,治疗仅影响部分单位而使大多数单位不受影响时,这种方法尤其有价值。合成控制方法利用未受影响的单位数据来估计受影响单位的反事实结果。当治疗实施后,这些估计值可与实际结果进行比较,以衡量治疗效应。创建准确的反事实结果面临插值偏差的挑战,这是一种在控制单位与受影响单位差异显著时已为人所知的现象。为解决这一问题,我们提出了两阶段方法:首先使用基于单位协变量的最近邻匹配来选择相似的控制单位,然后应用适用于高维数据的监督学习方法来估计反事实结果。使用六大型实验进行测试表明,该方法成功地提高了估计准确性。然而,我们的分析揭示了机器学习偏差——即来自牺牲偏差以换取方差降低的方法——会影响结果并影响关于治疗效应的结论。我们在大规模实验环境中记录了这种偏差,并提出了有效的去偏技术来解决这一挑战。
引用
@article{arxiv.2501.00119,
title = {Post Launch Evaluation of Policies in a High-Dimensional Setting},
author = {Shima Nassiri and Mohsen Bayati and Joe Cooprider},
journal= {arXiv preprint arXiv:2501.00119},
year = {2025}
}
备注
15 pages, 2 figures, 6 tables