中文

强大的 A/B 测试指标及其寻找之道

信息检索 2024-07-31 v1 应用统计

摘要

在线受控实验(即 A/B 测试)是真实世界推荐系统评估的根本。通常会将用户随机分配给某个系统变体,然后在整个实验期间跟踪、收集并聚合大量指标。用于评估哪个系统变体优于另一个的北极星指标(如长期增长或收入)至关重要。因此,大多数收集的指标都属于支持性质,旨在(i)提供对实验如何影响用户体验的理解,或(ii)在北极星指标变化不显著时(即类型 II 错误)允许自信决策。后者并不直接:假设处理变体导致更少但更长的会话,更多的浏览但更少的互动,那么,这是正面还是负面的结果?问题在于:当我们使用 A/B 测试进行决策时,如何评估支持性指标的实用性?在线平台通常会在任意时刻运行数十个实验。这为评估指标对在线评估的实用性提供了丰富信息。我们提出收集这些信息并利用它来量化感兴趣指标的类型 I、类型 II 和类型 III 错误,以及其统计功效分布(例如 z 分数和 p 值)。我们展示了在两个大型短视频平台(ShareChat 和 Moj)中构建此管道的成果与见解,凭借数百个过去的实验,找到具有高统计功效的在线指标。

关键词

引用

@article{arxiv.2407.20665,
  title  = {Powerful A/B-Testing Metrics and Where to Find Them},
  author = {Olivier Jeunen and Shubham Baweja and Neeti Pokharna and Aleksei Ustimenko},
  journal= {arXiv preprint arXiv:2407.20665},
  year   = {2024}
}

备注

Accepted to the Industry Track of the 2024 ACM Conference on Recommender Systems (RecSys '24)