中文

超立方体上指数权重的多项式时间算法

机器学习 2019-08-26 v5 机器学习

摘要

我们研究一个一般的在线线性优化问题(OLO)。每轮从包含 nn 个对象的固定全域中选择一个对象子集,并产生与该所选子集相关的线性代价。为衡量算法性能,我们使用后悔值(regret)这一概念,即所有迭代产生的总代价与事后最优固定子集代价之差。我们考虑该问题的全信息与 Bandit 反馈。该问题等价于 {0,1}n\{0,1\}^n 超立方体上的 OLO。Exp2 算法及其 bandit 变体是此问题的常用策略。此前未知是否可能在多项式时间内于超立方体上运行 Exp2。本文中,我们提出一种称为 PolyExp 的多项式时间算法用于超立方体上的 OLO。我们表明该算法等价于 {0,1}n\{0,1\}^n 上的 Exp2、在线镜像下降(OMD)、跟随正则化领导者(FTRL)与跟随扰动领导者(FTPL)算法。我们证明在 LL_\infty 对抗损失下,全信息设置中 PolyExp 的期望后悔界比 Exp2 优一个 n\sqrt{n} 因子。由于这些算法的等价性,这意味着全信息下 Exp2 后悔界的改进。我们还给出了匹配的后悔下界。最后,我们展示了如何在 {1,+1}n\{-1,+1\}^n 超立方体上使用 PolyExp,解决了 Bubeck 等人(COLT 2012)中的一个开放问题。

关键词

引用

@article{arxiv.1806.04594,
  title  = {Exponential Weights on the Hypercube in Polynomial Time},
  author = {Sudeep Raja Putta and Abhishek Shetty},
  journal= {arXiv preprint arXiv:1806.04594},
  year   = {2019}
}