PlanAlyzer:评估在线实验的有效性威胁
编程语言
2019-10-01 v1
摘要
在线实验无处不在。随着实验规模增长,其设计与实现的复杂性也随之增加。作为应对,企业开发了用于设计与部署在线实验的软件框架。确保这些框架中的实验设计正确且结果可信——即所谓*内部有效性*——可能十分困难。当前,验证内部有效性需由具备实验设计深厚专业知识者手动检查。我们提出首个静态检查在线实验内部有效性的方法。我们的检查基于实验设计与因果推断中已知的若干问题。我们的分析以 PlanOut 为目标,这是一个广泛部署的开源实验框架,使用领域特定语言指定并运行复杂实验。我们构建了工具 PlanAlyzer,可检查 PlanOut 程序中的多种内部有效性威胁,包括随机化、处理分配与因果充分性的失败。PlanAlyzer 利用其分析自动生成*对照(contrasts)*,一种对实验结果的有效统计析所必需的关键信息类型。我们在 Facebook 生产环境部署的 PlanOut 脚本语料上展示了 PlanAlyzer 的效用,并在该语料的变异子集上评估其识别有效性威胁的能力。PlanAlyzer 在变异语料上的精确率与召回率均为 92%,且其自动生成的对照中有 82% 与人工指定数据匹配。
引用
@article{arxiv.1909.13649,
title = {PlanAlyzer: Assessing Threats to the Validity of Online Experiments},
author = {Emma Tosch and Eytan Bakshy and Emery D. Berger and David D. Jensen and J. Eliot B. Moss},
journal= {arXiv preprint arXiv:1909.13649},
year = {2019}
}
备注
30 pages, hella long