推荐系统的离线 A/B 测试
机器学习
2018-01-23 v1 机器学习
摘要
在对推荐系统的新版本进行在线 A/B 测试之前,通常会在历史数据上执行一些离线评估。我们关注那些能够计算该技术可能带来的收益潜在提升估计量的评估方法。它有助于更快迭代,并通过检测劣质策略避免损失金钱。这些估计量被称为反事实(counterfactual)或离策略(off-policy)估计量。我们表明,传统的反事实估计量,如封顶重要性采样(capped importance sampling)和归一化重要性采样(normalised importance sampling),在面向在线广告的个性化产品推荐场景中,实验上并不具备令人满意的偏差-方差权衡。我们提出了两种具有不同偏差建模的反事实估计量变体,证明其在真实条件下是准确的。我们通过展示这些估计量与在商业推荐系统上运行在线 A/B 测试所观测到的业务指标之间的相关性,提供了这些估计量的基准测试。
引用
@article{arxiv.1801.07030,
title = {Offline A/B testing for Recommender Systems},
author = {Alexandre Gilotte and Clément Calauzènes and Thomas Nedelec and Alexandre Abraham and Simon Dollé},
journal= {arXiv preprint arXiv:1801.07030},
year = {2018}
}