基于替代策略的离屏评估与日志_bandit反馈学习:误差缩减
机器学习
2018-08-02 v1 最优化与控制
机器学习
摘要
当从一批日志 bandit 反馈中学习时,待学策略与离屏训练数据之间的差异带来了统计与计算挑战。与经典监督学习和在线学习设定不同,在批量上下文 bandit 学习中,只能访问由历史策略所采取动作产生的一批日志反馈,并期望学到在可能未观测到的上下文中采取良好动作的策略。这种批量学习设定在广告平台与推荐系统等在线交互系统中无处不在。基于逆倾向得分的现有方法,如逆倾向得分(IPS)与指数模型策略优化器(POEM),具有无偏性但常受较大均方误差困扰。本工作中,我们引入一种名为最大似然逆倾向得分(MLIPS)的新方法,用于从日志 bandit 反馈中进行批量学习。我们并非使用给定的历史策略作为逆倾向权重中的提议分布,而是基于日志动作-上下文对估计最大似然替代策略,并将该替代策略用作提议分布。我们证明 MLIPS 渐近无偏,且具比 IPS 更小的非渐近均方误差。这种误差缩减现象有些出人意料,因为所估计的替代策略不如给定的历史策略准确。在多标签分类问题与大规模广告放置数据集上的结果展示了 MLIPS 的经验有效性。此外,所提出的替代策略技术与现有误差缩减技术互补,且二者结合能持续提升若干广泛使用方法的性能。
引用
@article{arxiv.1808.00232,
title = {Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy},
author = {Yuan Xie and Boyi Liu and Qiang Liu and Zhaoran Wang and Yuan Zhou and Jian Peng},
journal= {arXiv preprint arXiv:1808.00232},
year = {2018}
}
备注
27 pages, 1 figure, 1 table