中文

改进的 Logistic 赌博机乐观算法

机器学习 2020-06-09 v2 机器学习

摘要

广义线性赌博机框架通过扩展已被充分理解的线性设定并允许建模更丰富的奖励结构,近年来吸引了大量关注。它尤其涵盖了在奖励为二值时被广泛使用的 logistic 模型。对于 logistic 赌博机,现有算法的频率主义遗憾保证为 O~(κT)\tilde{\mathcal{O}}(\kappa \sqrt{T}),其中 κ\kappa 是问题相关常数。不幸的是,κ\kappa 可以任意大,因为它随决策集大小呈指数缩放。这可能导致显著宽松的遗憾界和较差的实证性能。在这项工作中,我们研究 logistic 赌博机,重点关注 κ\kappa 引入的过高依赖。我们提出一种基于更精细考察奖励函数非线性的新乐观算法。我们证明其享有 O~(T)\tilde{\mathcal{O}}(\sqrt{T}) 的遗憾,除二阶项外不依赖 κ\kappa。我们的分析基于一个新的自归一化鞅的尾不等式,其本身具有独立意义。

关键词

引用

@article{arxiv.2002.07530,
  title  = {Improved Optimistic Algorithms for Logistic Bandits},
  author = {Louis Faury and Marc Abeille and Clément Calauzènes and Olivier Fercoq},
  journal= {arXiv preprint arXiv:2002.07530},
  year   = {2020}
}

备注

Accepted at ICML2020