中文

面向具有老虎机反馈的在线线性优化的极小极大策略

机器学习 2012-02-15 v1 机器学习

摘要

我们研究了具有老虎机反馈的在线线性优化问题。我们的贡献有两方面。首先,我们提供了一种基于指数权重的算法,对于任何具有 N 个动作的有限动作集,在瞬时损失以 1 为界的假设下,其遗憾度阶数为 dnlogN\sqrt{d n \log N}。与之前的工作相比,这消除了一個多余的 d\sqrt{d} 因子,并为任何紧致动作集给出了阶数为 dnlognd \sqrt{n \log n} 的遗憾界。在没有对动作集进行进一步假设的情况下,该遗憾界在忽略对数因子的意义下是极小极大最优的。有趣的是,我们的结果还表明,在 d 维空间中,具有专家建议的老虎机线性优化的极小极大遗憾度与具有专家建议的基本 d 臂老虎机相同。我们的第二个贡献是展示了如何利用镜像下降算法 (Mirror Descent algorithm) 在特定示例中获得具有极小极大最优遗憾界的计算高效策略。更具体地说,我们研究了两种典型动作集:超立方体和欧几里得球。在前一种情况下,我们获得了第一种具有 dnd \sqrt{n} 遗憾度的计算高效算法,从而比已知的最佳计算高效算法结果改进了 dlogn\sqrt{d \log n} 因子。在后一种情况下,我们的方法给出了第一种具有 dnlogn\sqrt{d n \log n} 遗憾度的算法,再次消除了与之前工作相比多余的 d\sqrt{d}

关键词

引用

@article{arxiv.1202.3079,
  title  = {Towards minimax policies for online linear optimization with bandit feedback},
  author = {Sébastien Bubeck and Nicolò Cesa-Bianchi and Sham M. Kakade},
  journal= {arXiv preprint arXiv:1202.3079},
  year   = {2012}
}