中文

具有在线 FDR 控制的多臂老虎机 A/B 测试框架

机器学习 2017-11-21 v2 机器学习 统计方法学

摘要

我们提出了一种替代框架,用于在多个 A/B 测试随时间运行时控制错误警报。这种设置出现在许多实际应用中,例如制药公司针对不同疾病测试新治疗方案与对照药丸,或互联网公司随时间测试其默认网页与各种替代方案。我们的框架建议用一系列最佳臂 MAB 实例替代一系列 A/B 测试,数据科学家可以对其进行连续监控。通过将 MAB 测试与在线错误发现率(FDR)算法交织,我们可以获得两全其美的效果:低样本复杂度和任意时刻的在线 FDR 控制。我们的主要贡献是: 提出针对 MAB 实例的零假设的合理定义; 展示如何推导出允许对每个 MAB 测试进行连续监控的始终有效的序贯 p 值; 证明将在线 FDR 算法的拒绝阈值用作 MAB 算法的置信水平,可在任意时刻实现样本最优性、高统计功效和低 FDR。我们进行了广泛的模拟以验证我们的主张,并报告了从《纽约客》卡通字幕竞赛中收集的真实数据结果。

关键词

引用

@article{arxiv.1706.05378,
  title  = {A framework for Multi-A(rmed)/B(andit) testing with online FDR control},
  author = {Fanny Yang and Aaditya Ramdas and Kevin Jamieson and Martin J. Wainwright},
  journal= {arXiv preprint arXiv:1706.05378},
  year   = {2017}
}

备注

Published as a conference paper at NIPS 2017