中文

有限动作集上带有限切换的在线学习

机器学习 2021-11-16 v2 最优化与控制

摘要

本文研究了在专家预测(PFE)问题与对抗多臂老虎机(MAB)问题中切换动作的价值。首先,我们重访了经过充分研究且具实际动机的带切换成本的PFE设定。已知许多算法在期望意义下对后悔值与切换次数均达到O(Tlogn)O(\sqrt{T \log n})的极小极大最优阶,其中TT为迭代次数,nn为动作数。然而,尚无高概率(h.p.)保证已知。我们的主要技术贡献是首批在高概率下对后悔值与切换次数均达到该最优阶的算法。这解决了[Devroye等人,2015]的一个开放问题,并直接给出了若干相关问题的首批高概率保证。接下来,为在更细粒度上考察切换动作的价值,我们引入切换预算设定,其中算法被限制于STS \leq T次动作间切换。这 entailed 有限数量的免费切换,与切换成本设定中无限数量的昂贵切换形成对比。利用上述结果及若干归约,我们统一了先前工作,并在至多小的多对数因子意义下完全刻画了该切换预算设定的复杂度:对PFE与MAB、对所有切换预算STS \leq T、以及对期望与高概率保证均如此。对PFE,我们给出最优速率为:当S=Ω(Tlogn)S = \Omega(\sqrt{T\log n})时为Θ~(Tlogn)\tilde{\Theta}(\sqrt{T\log n}),当S=O(Tlogn)S = O(\sqrt{T \log n})时为min(Θ~(TlognS),T)\min(\tilde{\Theta}(\tfrac{T\log n}{S}), T)。有趣的是,老虎机设定不展现此种相变;相反我们证明极小极大速率随STS \leq T所有范围稳步衰减为min(Θ~(TnS),T)\min(\tilde{\Theta}(\tfrac{T\sqrt{n}}{\sqrt{S}}), T)。这些结果恢复并推广了已知的(任意)切换成本设定的极小极大速率。

关键词

引用

@article{arxiv.1803.01548,
  title  = {Online learning over a finite action set with limited switching},
  author = {Jason Altschuler and Kunal Talwar},
  journal= {arXiv preprint arXiv:1803.01548},
  year   = {2021}
}

备注

Extended abstract to appear in the proceedings of the 2018 Conference on Learning Theory (COLT)