中文

具有 Hölder 连续性的全局老虎机

机器学习 2014-10-30 v1

摘要

标准的多臂老虎机 (MAB) 问题假设各臂是独立的。然而,在许多应用场景中,拉动一个臂所获得的信息提供了关于其余臂的信息。因此,在此类应用中,可以利用并应当利用这种信息性以实现向最优解的更快收敛。本文引入并形式化了全局多臂老虎机 (GMAB),其中各臂通过一个全局参数具有全局信息性,即选择一个臂会揭示关于所有臂的信息。我们提出了一种用于 GMAB 的贪婪策略,该策略总是选择估计期望奖励最高的臂,并证明其实现了有界的依赖于参数的遗憾值。因此,该策略仅在有限次内选择次优臂,并且在有限个初始时间步之后,以概率 1 在所有剩余时间步中选择最优臂。此外,我们还研究了臂之间关于彼此奖励的信息性如何影响学习速度。具体而言,我们证明了无参数(最坏情况)遗憾值随时间呈次线性增长,并随着臂的信息性增加而减小。我们还证明了 GMAB 的一个随时间呈次线性的贝叶斯风险界,当各臂完全信息性时,该界退化为线性参数化老虎机的著名贝叶斯风险界。GMAB 的应用范围从药物和治疗发现到动态定价。

关键词

引用

@article{arxiv.1410.7890,
  title  = {Global Bandits with Holder Continuity},
  author = {Onur Atan and Cem Tekin and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:1410.7890},
  year   = {2014}
}