短寿命高容量多臂/多组测试
机器学习
2023-12-27 v1 机器学习
摘要
现代平台利用随机实验从给定的一组项目(“处理”)中做出明智决策。作为一个特别具有挑战性的场景,这些项目可能 (i) 以高容量到达,每小时发布数千个新项目,并且 (ii) 寿命短暂,例如由于项目的瞬时性质或潜在的非平稳性,迫使平台将同一项目视为随时间变化的不同副本。受此动机驱动,我们研究了一个贝叶斯多玩老虎机问题,该问题封装了具有高容量短寿命臂的多变量测试(或“多 A/B 测试”)问题的关键特征。在每一轮中,一组 个臂到达,每个臂可用 轮。在不知道每个臂的平均奖励的情况下,学习者选择一个包含 个臂的多重集并立即观察其实现的奖励。我们的目标是最小化因不知道平均奖励而造成的损失,该损失是对从给定先验分布生成的实例取平均。我们表明,当 对于某个常数 时,我们提出的策略在足够大的一类先验分布上具有 的损失。我们通过证明每个策略在同一类分布上遭受 的损失来补充这一结果。我们进一步通过在 {\em Glance}(一个面临上述确切挑战的内容卡片服务平台)上进行的大规模现场实验验证了我们策略的有效性。我们策略的一个简单变体在总持续时间和总点击次数上分别比平台当前的推荐系统高出 4.32\% 和 7.48\%。
引用
@article{arxiv.2312.15356,
title = {Short-lived High-volume Multi-A(rmed)/B(andits) Testing},
author = {Su Jia and Andrew Li and R. Ravi and Nishant Oli and Paul Duff and Ian Anderson},
journal= {arXiv preprint arXiv:2312.15356},
year = {2023}
}