基于位置模型与Bandit反馈的学习排序
机器学习
2020-04-29 v1 机器学习
摘要
个性化是许多在线体验的关键方面。特别地,内容排序通常是提供复杂个性化结果的关键组成部分。通常应用监督式学习排序(learning-to-rank)方法,这些方法受到负责生成排序的生产系统在数据收集期间引入的偏差的影响。为补偿此问题,我们利用上下文多臂 bandit(multi-armed bandits)。我们提出了两种知名算法即 LinUCB 和 Linear Thompson Sampling 在排序用例中的新扩展。为解释生产环境中的偏差,我们采用基于位置的点击模型(position-based click model)。最后,我们通过在合成数据集上进行广泛的离线实验以及面向客户的在线 A/B 实验,展示了所提算法的有效性。
引用
@article{arxiv.2004.13106,
title = {Learning to Rank in the Position Based Model with Bandit Feedback},
author = {Beyza Ermis and Patrick Ernst and Yannik Stein and Giovanni Zappella},
journal= {arXiv preprint arXiv:2004.13106},
year = {2020}
}