中文

组合老虎机重温

机器学习 2015-11-09 v3 最优化与控制 机器学习

摘要

本文研究随机与对抗组合多臂老虎机问题。在半老虎机反馈(semi-bandit feedback)的随机设定下,我们推导了特定问题的后悔下界,并讨论其随决策空间维度的缩放关系。我们提出 ESCB,一种有效利用问题结构的算法,并给出其后悔的有限时间分析。ESCB 比现有算法具有更好的性能保证,且在实践中显著优于这些算法。在老虎机反馈(bandit feedback)的对抗设定下,我们提出 \textsc{CombEXP} 算法,其后悔缩放与最先进算法相同,但对于某些组合问题具有更低的计算复杂度。

关键词

引用

@article{arxiv.1502.03475,
  title  = {Combinatorial Bandits Revisited},
  author = {Richard Combes and M. Sadegh Talebi and Alexandre Proutiere and Marc Lelarge},
  journal= {arXiv preprint arXiv:1502.03475},
  year   = {2015}
}

备注

30 pages, Advances in Neural Information Processing Systems 28 (NIPS 2015)