设定在线A/B实验的持续时间
统计方法学
2024-08-07 v1 机器学习
摘要
在设计在线A/B实验时,选择合适的样本量和持续时间至关重要,以确保对处理效应的置信区间(CI)宽度能够以足够的统计功效检测到有意义的效应大小,同时不浪费资源。虽然样本量与CI宽度之间的关系已广为人知,但实验持续时间对CI宽度的影响仍不太清晰。本文提供了基于比例处理效应估计器的CI宽度解析公式,作为样本量(N)和持续时间(T)的函数。该公式源自带两个方差分量的混合效应模型。一个分量称为时间方差,持续存在于时间之上,因为实验中同一用户跨越不同天数保持在同一实验臂中。另一分量则随着T增大而趋于零。我们推导出的公式引入了一个关键参数,我们称为用户特定时间相关性(UTC),用于量化两个方差分量的相对大小,可从历史实验中估计。UTC越高,CI宽度随时间衰减得越慢。另一方面,当UTC为0——即实验中用户跨越不同天数随机进入和退出实验臂时——CI宽度以标准的参数1/T速率衰减。我们还研究了获取实验前期数据对CI宽度衰减的影响。我们展示了该公式在YouTube上的真实A/B实验中能够很好地解释CI宽度。
引用
@article{arxiv.2408.02830,
title = {Setting the duration of online A/B experiments},
author = {Harrison H. Li and Chaoyu Yu},
journal= {arXiv preprint arXiv:2408.02830},
year = {2024}
}