组合老虎机重温
机器学习
2015-11-09 v3 最优化与控制
机器学习
摘要
本文研究随机与对抗组合多臂老虎机问题。在半老虎机反馈(semi-bandit feedback)的随机设定下,我们推导了特定问题的后悔下界,并讨论其随决策空间维度的缩放关系。我们提出 ESCB,一种有效利用问题结构的算法,并给出其后悔的有限时间分析。ESCB 比现有算法具有更好的性能保证,且在实践中显著优于这些算法。在老虎机反馈(bandit feedback)的对抗设定下,我们提出 \textsc{CombEXP} 算法,其后悔缩放与最先进算法相同,但对于某些组合问题具有更低的计算复杂度。
引用
@article{arxiv.1502.03475,
title = {Combinatorial Bandits Revisited},
author = {Richard Combes and M. Sadegh Talebi and Alexandre Proutiere and Marc Lelarge},
journal= {arXiv preprint arXiv:1502.03475},
year = {2015}
}
备注
30 pages, Advances in Neural Information Processing Systems 28 (NIPS 2015)