中文

赌博机及更广领域中兼得对抗与随机最优的黑名单方法

机器学习 2023-02-21 v1 人工智能 机器学习

摘要

在线学习中兼得对抗与随机两种机制近优遗憾的“两全其美”(best-of-both-worlds)算法近来受到越来越多的关注。现有技术常需针对每个新问题设定进行细致适配,包括专门的势函数与算法参数的精细调节。然而,在线性赌博机等领域,是否存一种算法能在随机机制下取得 O(log(T))O(\log(T)) 遗憾、在对抗机制下取得 O~(T)\tilde{O}(\sqrt{T}) 遗憾,至今未知。本文肯定地解决了该问题,并给出了从两全其美到一大类跟随正则化领导者(FTRL)与在线镜像下降(OMD)算法的通用归约。我们通过将仅已知具最坏情况保证的现有算法,转化为在情境赌博机、图赌博机与表格马尔可夫决策过程中具两全其美保证的新算法,展示了该归约的能力。

关键词

引用

@article{arxiv.2302.09739,
  title  = {A Blackbox Approach to Best of Both Worlds in Bandits and Beyond},
  author = {Christoph Dann and Chen-Yu Wei and Julian Zimmert},
  journal= {arXiv preprint arXiv:2302.09739},
  year   = {2023}
}