利用多臂老虎机加速推荐系统的学习
信息检索
2019-08-20 v1 机器学习
摘要
推荐系统是许多在线市场的关键组成部分,其中常有数百万件商品可能展示给需求各异的用户。鉴于数据中所有的固有偏差,评估推荐系统算法是一项困难的任务,成功的公司必须能够快速迭代其解决方案以保持竞争优势。评估推荐算法的黄金标准是 A/B 测试,因为它是一种无偏估计一个或多个算法在真实世界中表现对比的方法。然而,A/B 测试存在若干使其不宜作为唯一测试方法的问题,包括较长的前置时间以及探索成本高。我们认为多臂老虎机(MAB)测试可作为这些问题的解决方案。我们展示了如何在生产系统中将 MAB 方案实现为离线 A/B 测试与在线 A/B 测试之间的额外步骤。我们给出了实验的结果,并针对我们的用例比较了所有离线、MAB 与在线 A/B 测试的度量指标。
引用
@article{arxiv.1908.06158,
title = {Accelerated learning from recommender systems using multi-armed bandit},
author = {Meisam Hejazinia and Kyler Eastman and Shuqin Ye and Abbas Amirabadi and Ravi Divvela},
journal= {arXiv preprint arXiv:1908.06158},
year = {2019}
}