中文

综合证据:数据池化作为在线实验中处理方案选择的工具

统计方法学 2025-08-18 v2

摘要

随机实验是因果推断的黄金标准,但在商业应用中面临重大挑战,包括有限的流量分配、异质性处理效应估计的需求以及管理重叠实验的复杂性。这些因素导致处理效应估计的高变异性,使得数据驱动的策略推广变得困难。为解决这些问题,我们引入了数据池化处理推广(DPTR)框架,该框架通过跨实验池化数据而非狭隘地关注单个实验来增强策略推广。无论线性或非线性模型设定如何,DPTR 都能有效适应重叠和非重叠流量场景。我们通过三重验证展示了该框架的稳健性:(a) 理论分析表明,在非重叠实验下,DPTR 超越了传统的均值差和普通最小二乘法,尤其在实验数量较多时;(b) 合成模拟证实了其在具有重叠流量、丰富协变量和非线性设定的复杂场景中的适应性;(c) 对来自真实世界平台的两个实验数据集进行了实证应用,展示了其在指导单个实验内子群体的定制化策略推广,以及在重叠场景下协调多个实验的策略部署方面的有效性。通过降低估计变异性以提高决策效能,DPTR 为在线平台在当前日益复杂的商业环境中更好地利用其实验数据提供了一种可扩展、实用的解决方案。

关键词

引用

@article{arxiv.2508.10331,
  title  = {Synthesizing Evidence: Data-Pooling as a Tool for Treatment Selection in Online Experiments},
  author = {Zhenkang Peng and Chengzhang Li and Ying Rong and Renyu Zhang},
  journal= {arXiv preprint arXiv:2508.10331},
  year   = {2025}
}