中文

所见未必所得:对 ε-污染鲁棒的 UCB 赌博机算法

机器学习 2020-06-19 v3 机器学习

摘要

受赌博机算法在教育中应用的启发,我们考虑一个具有 ε\varepsilon-污染奖励的随机多臂赌博机问题。我们允许 adversary 在完全知晓过去与未来的情况下给出任意无界污染奖励。我们施加约束:对每个时刻 tt,任一动作的污染奖励比例不超过 ε\varepsilon。我们推导了在 ε\varepsilon-污染情形下两类针对亚高斯分布的鲁棒均值估计量的集中不等式。我们定义了 ε\varepsilon-污染随机赌博机问题,并利用鲁棒均值估计量给出鲁棒上置信界(UCB)算法 crUCB 的两个变体。仅基于潜在随机奖励得出的后悔值表明,当污染比例足够小时,crUCB 的两个变体均达到 O(KTlogT)\mathcal{O} (\sqrt{KT\log T}) 后悔值。我们的仿真假设较小时间范围,反映了教育赌博机这一新近探索的设置。我们表明,在某些对抗机制下,即使我们关于污染奖励比例的约束被打破,crUCB 不仅优于为随机(UCB1)和对抗(EXP3)赌博机设计的算法,也优于具有“两全其美”保证的算法(EXP3++ 和 TsallisInf)。

关键词

引用

@article{arxiv.1910.05625,
  title  = {What You See May Not Be What You Get: UCB Bandit Algorithms Robust to {\epsilon}-Contamination},
  author = {Laura Niss and Ambuj Tewari},
  journal= {arXiv preprint arXiv:1910.05625},
  year   = {2020}
}

备注

Changes to reflect UAI2020 accepted paper