中文

随机线性_bandit 的一般理论及其应用

机器学习 2022-04-04 v4 机器学习

摘要

近年来实验中越来越多地采用在线实验,导致多臂_bandit 作为降低在线实验机会成本的技术受到广泛关注。在该设定中,决策者依次从给定动作集合中选择,观察其带噪奖励,并旨在长度为 TT 的时域内最大化其累积期望奖励(或最小化后悔)。在本文中,我们为随机线性_bandit 问题引入了一个一般分析框架及一族算法,该框架将著名的算法如不确定性面前乐观线性_bandit(OFUL)和 Thompson 采样(TS)作为特例包含在内。我们的分析技术沟通了多条先前文献脉络,并产生了若干新结果。首先,我们关于期望中乐观的新概念催生了一种称为筛贪心(SG)的新算法,它减轻了 OFUL 中的过度探索问题。SG 利用数据丢弃不确定性相对较低的动作,然后在剩余动作中贪心地选择一个。除了证明 SG 在理论上是速率最优的之外,我们的经验模拟显示 SG 优于贪心、OFUL 和 TS 等现有基准。我们一般框架的第二个应用是(据我们所知)在类似于 Goldenshluger 和 Zeevi(2013)的条件下,OFUL 和 TS 的首个多对数(关于 TT)后悔界。最后,我们通过因子 k\sqrt{k} 获得了 kk 臂上下文 MAB 的更紧后悔界。

关键词

引用

@article{arxiv.2002.05152,
  title  = {A General Theory of the Stochastic Linear Bandit and Its Applications},
  author = {Nima Hamidi and Mohsen Bayati},
  journal= {arXiv preprint arXiv:2002.05152},
  year   = {2022}
}