跨众多弱实验评估决策规则
统计方法学
2025-05-30 v2
摘要
技术公司通过进行随机对照实验('A/B 测试')来学习哪些行动可以改善业务结果。在拥有成熟实验平台的公司中,实验项目可以包含数千项测试。为了有效扩展实验,企业依赖决策规则:将实验结果映射到选择要推广至整个用户群体的处理 arm 的标准操作程序。尽管决策规则在将实验转化为业务决策方面发挥着关键作用,但关于如何评估和选择决策规则的严格指导方面仍显稀缺。本文提出以累计业务北极指标收益来评估决策规则。虽然这一量度直观且易于向决策者解释,但在实验信噪比较弱时估计这一量会很困难,尤其是当实验信号与噪声比率较弱时。我们发展了一种在数字实验中符合现实条件的交叉验证估计器,其偏差远低于粗略插值估计器。在我们通过 Netflix 123 项历史 A/B 测试的案例研究中,我们展示了该方法的有效性,通过该方法我们证明,新的决策规则将通过北极指标实现约 33% 的累计收益提升,直接导致了该新规则的采纳。
引用
@article{arxiv.2502.08763,
title = {Evaluating Decision Rules Across Many Weak Experiments},
author = {Winston Chou and Colin Gray and Nathan Kallus and Aurélien Bibaut and Simon Ejdemyr},
journal= {arXiv preprint arXiv:2502.08763},
year = {2025}
}
备注
Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '25), August 3--7, 2025, Toronto, ON, Canada