超立方体上指数权重的多项式时间算法
机器学习
2019-08-26 v5 机器学习
摘要
我们研究一个一般的在线线性优化问题(OLO)。每轮从包含 个对象的固定全域中选择一个对象子集,并产生与该所选子集相关的线性代价。为衡量算法性能,我们使用后悔值(regret)这一概念,即所有迭代产生的总代价与事后最优固定子集代价之差。我们考虑该问题的全信息与 Bandit 反馈。该问题等价于 超立方体上的 OLO。Exp2 算法及其 bandit 变体是此问题的常用策略。此前未知是否可能在多项式时间内于超立方体上运行 Exp2。本文中,我们提出一种称为 PolyExp 的多项式时间算法用于超立方体上的 OLO。我们表明该算法等价于 上的 Exp2、在线镜像下降(OMD)、跟随正则化领导者(FTRL)与跟随扰动领导者(FTPL)算法。我们证明在 对抗损失下,全信息设置中 PolyExp 的期望后悔界比 Exp2 优一个 因子。由于这些算法的等价性,这意味着全信息下 Exp2 后悔界的改进。我们还给出了匹配的后悔下界。最后,我们展示了如何在 超立方体上使用 PolyExp,解决了 Bubeck 等人(COLT 2012)中的一个开放问题。
引用
@article{arxiv.1806.04594,
title = {Exponential Weights on the Hypercube in Polynomial Time},
author = {Sudeep Raja Putta and Abhishek Shetty},
journal= {arXiv preprint arXiv:1806.04594},
year = {2019}
}