将多臂老虎机策略适配于上下文老虎机场景
机器学习
2019-11-26 v2 机器学习
摘要
本工作探索将成功的多臂老虎机(multi-armed bandits)策略适配于具有二元奖励的在线上下文老虎机(contextual bandits)场景,使用逻辑回归等二分类算法作为黑盒预言机。其中部分适配通过自助法或近似自助法实现,另一些则依赖其他形式的随机性,从而产生了比以往工作更具可扩展性的方法,并能够使用任意类型的分类算法。特别地,Adaptive-Greedy 算法展现出很大潜力,在许多情况下以更多超参数调优为代价,取得了优于上置信界(UCB)和 Thompson 采样策略的性能。
引用
@article{arxiv.1811.04383,
title = {Adapting multi-armed bandits policies to contextual bandits scenarios},
author = {David Cortes},
journal= {arXiv preprint arXiv:1811.04383},
year = {2019}
}