中文

逻辑_bandit的实例级极小极大最优算法

机器学习 2021-03-10 v2 机器学习

摘要

逻辑_bandit(Logistic Bandits)近来备受关注,其提供了一个简洁而具挑战性的框架,用以理解参数化_bandit中非线性带来的影响。Faury 等人(2020)指出,逻辑_bandit在学习理论上的困难可归结为一个较大的(有时大到难以接受)问题相关常数 κ\kappa,它刻画了奖励非线性的量级。本文引入一种新算法并给出精细化分析,从而更好地刻画非线性的影响,并得出改进的问题相关保证。在最有利情形下,其遗憾上界为 O~(dT/κ)\tilde{\mathcal{O}}(d\sqrt{T/\kappa}),相比 O~(dT+κ)\tilde{\mathcal{O}}(d\sqrt{T}+\kappa) 的现有最优保证有显著提升。我们推导出 Ω(dT/κ)\Omega(d\sqrt{T/\kappa}) 的问题相关下界,证明该速率是极小极大最优的。我们的分析识别出遗憾的两个阶段(永久性与过渡性),最终调和了 Faury 等人(2020)与 Dong 等人(2019)的贝叶斯方法。与先前工作不同,我们发现永久性阶段中非线性可极大缓解探索-利用权衡;尽管它也以问题相关方式影响过渡阶段长度,但我们表明在大多数合理配置下该影响较温和。

关键词

引用

@article{arxiv.2010.12642,
  title  = {Instance-Wise Minimax-Optimal Algorithms for Logistic Bandits},
  author = {Marc Abeille and Louis Faury and Clément Calauzènes},
  journal= {arXiv preprint arXiv:2010.12642},
  year   = {2021}
}

备注

40 pages. AISTATS 2021, oral