中文

上下文随机_bandit问题中的模型选择

机器学习 2022-12-06 v3 机器学习

摘要

我们研究随机环境中的_bandit模型选择。我们的方法依赖于一个在候选基算法间进行选择的元算法。我们开发了一种元算法-基算法抽象,可适用于一般类别的基算法和不同类型的对抗性元算法。我们的方法依赖于一种新颖且通用的_bandit算法平滑变换,只要最优基算法满足高概率后悔保证,就能为随机上下文_bandit问题获得最优的 O(T)O(\sqrt{T}) 模型选择保证。我们通过下界证明,即使某个基算法具有 O(logT)O(\log T) 后悔值,一般而言模型选择中也不可能获得优于 Ω(T)\Omega(\sqrt{T}) 的后悔值,即使是渐近地。利用我们的技术,我们处理了多种问题中的模型选择,如错误指定的线性上下文_bandit、未知维数线性_bandit以及具有未知特征映射的强化学习。我们的算法需要知晓最优基后悔值以调整元算法学习率。我们表明,若无此类先验知识,任何元算法都可能遭受大于最优基后悔值的后悔值。

关键词

引用

@article{arxiv.2003.01704,
  title  = {Model Selection in Contextual Stochastic Bandit Problems},
  author = {Aldo Pacchiano and My Phan and Yasin Abbasi-Yadkori and Anup Rao and Julian Zimmert and Tor Lattimore and Csaba Szepesvari},
  journal= {arXiv preprint arXiv:2003.01704},
  year   = {2022}
}

备注

33 main pages, 15 appendix pages