超越UCB:基于回归预言机的上下文老虎机最优与高效算法
机器学习
2020-06-24 v2 统计理论
机器学习
统计理论
摘要
上下文老虎机的一个根本挑战是开发灵活的通用算法,其计算需求不差于分类与回归等经典监督学习任务。基于回归的算法已展现出令人鼓舞的实证成功,但除特殊情况外理论保证一直难以捉摸。我们给出了从上下文老虎机到在线回归的第一个通用且最优的归约。我们展示了如何将任意针对给定值函数类的在线回归预言机转化为针对所诱导策略类的上下文老虎机算法,且在运行时间与内存需求上无额外开销。我们刻画了具有一般、可能非参数函数类的上下文老虎机的极小极大速率,并表明当预言机取得回归的最优速率时我们的算法是极小极大最优的。与先前结果相比,我们的算法除可实现性外无需任何分布假设,且即使在上下文被对抗性选择时也有效。
引用
@article{arxiv.2002.04926,
title = {Beyond UCB: Optimal and Efficient Contextual Bandits with Regression Oracles},
author = {Dylan J. Foster and Alexander Rakhlin},
journal= {arXiv preprint arXiv:2002.04926},
year = {2020}
}
备注
ICML 2020