上下文_bandit的实例最优PAC算法
机器学习
2023-10-04 v1 机器学习
摘要
在随机上下文_bandit设定中,最小化后悔的算法已被广泛研究,但其实例最小化的优臂识别对应算法仍鲜有研究。在本文中,我们关注 - 设定下的随机_bandit问题:给定策略类 ,学习者的目标是返回一个策略 ,其期望奖励以大于 的概率处于最优策略的 范围内。我们通过量 刻画了上下文_bandit的第一个 PAC 样本复杂度,并针对不可知与线性上下文优臂识别设定给出了关于 的匹配上下界。我们表明,没有任何算法能同时对于后悔最小化与实例相关 PAC 优臂识别是极小极大最优的。我们的主要结果是一个新的实例最优且计算高效的算法,其依赖于对 argmax 预言机的多项式次调用。
引用
@article{arxiv.2207.02357,
title = {Instance-optimal PAC Algorithms for Contextual Bandits},
author = {Zhaoqi Li and Lillian Ratliff and Houssam Nassif and Kevin Jamieson and Lalit Jain},
journal= {arXiv preprint arXiv:2207.02357},
year = {2023}
}