逻辑_bandit的实例级极小极大最优算法
机器学习
2021-03-10 v2 机器学习
摘要
逻辑_bandit(Logistic Bandits)近来备受关注,其提供了一个简洁而具挑战性的框架,用以理解参数化_bandit中非线性带来的影响。Faury 等人(2020)指出,逻辑_bandit在学习理论上的困难可归结为一个较大的(有时大到难以接受)问题相关常数 ,它刻画了奖励非线性的量级。本文引入一种新算法并给出精细化分析,从而更好地刻画非线性的影响,并得出改进的问题相关保证。在最有利情形下,其遗憾上界为 ,相比 的现有最优保证有显著提升。我们推导出 的问题相关下界,证明该速率是极小极大最优的。我们的分析识别出遗憾的两个阶段(永久性与过渡性),最终调和了 Faury 等人(2020)与 Dong 等人(2019)的贝叶斯方法。与先前工作不同,我们发现永久性阶段中非线性可极大缓解探索-利用权衡;尽管它也以问题相关方式影响过渡阶段长度,但我们表明在大多数合理配置下该影响较温和。
引用
@article{arxiv.2010.12642,
title = {Instance-Wise Minimax-Optimal Algorithms for Logistic Bandits},
author = {Marc Abeille and Louis Faury and Clément Calauzènes},
journal= {arXiv preprint arXiv:2010.12642},
year = {2021}
}
备注
40 pages. AISTATS 2021, oral