中文

阶段式保守线性_bandit

机器学习 2020-10-02 v1 人工智能 系统与控制 系统与控制 机器学习

摘要

我们研究阶段式保守线性随机 bandit:这是 bandit 优化的一类实例,它考虑了在在线广告与医学试验等应用中出现的(未知)安全约束。在每个阶段,学习者必须选择不仅在整个时间范围内最大化累积奖励,而且满足以瞬时奖励下界形式出现的线性基线约束的动作。针对该问题,我们提出两种新算法:阶段式保守线性 Thompson Sampling(SCLTS)与阶段式保守线性 UCB(SCLUCB),它们遵守基线约束并分别具有 O(\sqrt{T} \log^{3/2}T) 与 O(\sqrt{T} \log T) 阶的概率后悔界。值得注意的是,所提算法仅需微小修改即可应对不同的问题变体,例如具有 bandit 反馈的约束,或未知的基线动作序列。我们讨论了这些以及相对于当前最优水平的其它改进。例如,与现有解相比,我们展示 SCLTS 播放(非最优)基线动作至多 O(\log{T}) 次(相比之下现有为 O(\sqrt{T}))。最后,我们联系到另一种被研究的安全约束形式,即瞬时奖励的上界。虽然这给学习过程带来额外复杂性,因为最优动作不保证在每轮都属于安全集,我们展示 SCLUCB 可通过简单修改在此设定中恰当调整。

关键词

引用

@article{arxiv.2010.00081,
  title  = {Stage-wise Conservative Linear Bandits},
  author = {Ahmadreza Moradipari and Christos Thrampoulidis and Mahnoosh Alizadeh},
  journal= {arXiv preprint arXiv:2010.00081},
  year   = {2020}
}

备注

28 pages, 5 figures