具有弱遗憾的对抗老虎机
机器学习
2017-06-15 v1
摘要
我们考虑通过成对比较的隐式反馈进行在线内容推荐,将其形式化为所谓的对抗老虎机问题。我们在 Condorcet 赢家设定下研究对抗老虎机问题,并考虑两种遗憾概念:研究较多的强遗憾,仅当拉动的两个臂均为 Condorcet 赢家时才为 0;以及研究较少的弱遗憾,若拉动的任一臂为 Condorcet 赢家时即为 0。我们针对此问题提出了一种新算法,Winner Stays (WS),并针对每种遗憾提供了变体:用于弱遗憾的 WS (WS-W) 的期望累积弱遗憾为 ,若臂存在全序则为 ;用于强遗憾的 WS (WS-S) 的期望累积强遗憾为 ,若臂存在全序则为 。WS-W 是首个弱遗憾在时间上为常数的对抗老虎机算法。WS 易于计算,即使对于具有许多臂的问题也是如此,我们通过在模拟和真实数据上的数值实验证明,无论是在弱遗憾还是强遗憾设定下,WS 的遗憾均显著小于现有算法。
引用
@article{arxiv.1706.04304,
title = {Dueling Bandits With Weak Regret},
author = {Bangrui Chen and Peter I. Frazier},
journal= {arXiv preprint arXiv:1706.04304},
year = {2017}
}