中文

具有弱遗憾的对抗老虎机

机器学习 2017-06-15 v1

摘要

我们考虑通过成对比较的隐式反馈进行在线内容推荐,将其形式化为所谓的对抗老虎机问题。我们在 Condorcet 赢家设定下研究对抗老虎机问题,并考虑两种遗憾概念:研究较多的强遗憾,仅当拉动的两个臂均为 Condorcet 赢家时才为 0;以及研究较少的弱遗憾,若拉动的任一臂为 Condorcet 赢家时即为 0。我们针对此问题提出了一种新算法,Winner Stays (WS),并针对每种遗憾提供了变体:用于弱遗憾的 WS (WS-W) 的期望累积弱遗憾为 O(N2)O(N^2),若臂存在全序则为 O(Nlog(N))O(N\log(N));用于强遗憾的 WS (WS-S) 的期望累积强遗憾为 O(N2+Nlog(T))O(N^2 + N \log(T)),若臂存在全序则为 O(Nlog(N)+Nlog(T))O(N\log(N)+N\log(T))。WS-W 是首个弱遗憾在时间上为常数的对抗老虎机算法。WS 易于计算,即使对于具有许多臂的问题也是如此,我们通过在模拟和真实数据上的数值实验证明,无论是在弱遗憾还是强遗憾设定下,WS 的遗憾均显著小于现有算法。

关键词

引用

@article{arxiv.1706.04304,
  title  = {Dueling Bandits With Weak Regret},
  author = {Bangrui Chen and Peter I. Frazier},
  journal= {arXiv preprint arXiv:1706.04304},
  year   = {2017}
}