中文

上下文_bandit的实例最优PAC算法

机器学习 2023-10-04 v1 机器学习

摘要

在随机上下文_bandit设定中,最小化后悔的算法已被广泛研究,但其实例最小化的优臂识别对应算法仍鲜有研究。在本文中,我们关注 (ϵ,δ)(\epsilon,\delta)-PAC\textit{PAC} 设定下的随机_bandit问题:给定策略类 Π\Pi,学习者的目标是返回一个策略 πΠ\pi\in \Pi,其期望奖励以大于 1δ1-\delta 的概率处于最优策略的 ϵ\epsilon 范围内。我们通过量 ρΠ\rho_{\Pi} 刻画了上下文_bandit的第一个 实例相关\textit{实例相关} PAC 样本复杂度,并针对不可知与线性上下文优臂识别设定给出了关于 ρΠ\rho_{\Pi} 的匹配上下界。我们表明,没有任何算法能同时对于后悔最小化与实例相关 PAC 优臂识别是极小极大最优的。我们的主要结果是一个新的实例最优且计算高效的算法,其依赖于对 argmax 预言机的多项式次调用。

关键词

引用

@article{arxiv.2207.02357,
  title  = {Instance-optimal PAC Algorithms for Contextual Bandits},
  author = {Zhaoqi Li and Lillian Ratliff and Houssam Nassif and Kevin Jamieson and Lalit Jain},
  journal= {arXiv preprint arXiv:2207.02357},
  year   = {2023}
}