中文

线性老虎机的最优算法

机器学习 2012-02-15 v3 机器学习

摘要

我们为在线老虎机线性优化提供了第一个算法,其在 T 轮后的遗憾在 d 维的 N 个动作的任意有限类 X 上达到 TdlnN\sqrt{Td \ln N} 阶,在 X 无限时达到 dTd\sqrt{T} 阶(在对数因子范围内)。这些界在一般情况下不可改进。基本思想利用凸几何工具来构造本质上最优的探索基。我们还展示了在线性老虎机专家意见模型中的应用。有趣的是,这些结果表明,d 维专家意见下的老虎机线性优化在可实现遗憾方面并不比专家意见下的在线 d-臂老虎机问题更难(其中 EXP4 是最优的)。

关键词

引用

@article{arxiv.1110.4322,
  title  = {An Optimal Algorithm for Linear Bandits},
  author = {Nicolò Cesa-Bianchi and Sham Kakade},
  journal= {arXiv preprint arXiv:1110.4322},
  year   = {2012}
}

备注

This paper is superseded by S. Bubeck, N. Cesa-Bianchi, and S.M. Kakade, "Towards minimax policies for online linear optimization with bandit feedback"