基于Bandit反馈训练的三种方法
信息检索
2019-09-18 v2 机器学习
摘要
在推荐系统日志上训练机器学习模型有三种截然不同的方法。第一种方法是对每个可能向用户做出的推荐建模其奖励预测,在打分时刻通过对个性化推荐计算argmax找到最佳推荐。该方法遵循条件性原则与似然原则等原理。第二种方法在模型不符合现实且欠拟合时有用。此时,我们可以利用已知历史推荐分布(集中于先前识别出的良好动作并带有一定探索)来调整拟合误差,使其在所有动作上均匀分布。最后,逆倾向得分可用于估计决策规则的期望性能。后两种方法违背条件性与似然原则,但被证明在特定设置下具有良好性能。本文回顾围绕这一根本却常被忽视的选择的相关文献,并使用RecoGym仿真环境进行了一些实验。
引用
@article{arxiv.1904.10799,
title = {Three Methods for Training on Bandit Feedback},
author = {Dmytro Mykhaylov and David Rohde and Flavian Vasile and Martin Bompaire and Olivier Jeunen},
journal= {arXiv preprint arXiv:1904.10799},
year = {2019}
}
备注
5 pages 2 figures