中文

t 检验探水:为可靠的 A/B 测试实证验证假设

统计方法学 2025-02-25 v2 机器学习

摘要

A/B 测试是网络实验设计的基石,具有广泛的应用和用例。比较均值差异的统计 t 检验是评估处理效应最常用的方法,通常通过中心极限定理 (Central Limit Theorem, CLT) 来证明其合理性。CLT 确定,随着样本量的增长,平均处理效应的抽样分布收敛于正态分布,使得 t 检验在样本量足够大时有效。当结果度量是偏态或非正态时,量化“足够大”的含义并非易事。为确保置信区间保持适当的覆盖率,且 p 值准确反映假阳性率,验证这一正态性假设至关重要。我们提出了一种实用的检验方法,通过分析重复重抽样的 A/A 测试来实现。当正态性假设成立时,得到的 p 值分布应是均匀的,并且可以使用 Kolmogorov-Smirnov 检验来检验这一性质。这提供了一种高效且有效的方法,以实证评估 t 检验的假设是否得到满足,以及 A/B 测试是否有效。我们展示了我们的方法,并强调了它如何帮助识别容易导致 I 类错误膨胀的场景。我们的方法提供了一个实用的框架,以确保并提高 A/B 测试实践的可靠性和稳健性。

关键词

引用

@article{arxiv.2502.04793,
  title  = {$t$-Testing the Waters: Empirically Validating Assumptions for Reliable A/B-Testing},
  author = {Olivier Jeunen},
  journal= {arXiv preprint arXiv:2502.04793},
  year   = {2025}
}