赌博机及更广领域中兼得对抗与随机最优的黑名单方法
机器学习
2023-02-21 v1 人工智能
机器学习
摘要
在线学习中兼得对抗与随机两种机制近优遗憾的“两全其美”(best-of-both-worlds)算法近来受到越来越多的关注。现有技术常需针对每个新问题设定进行细致适配,包括专门的势函数与算法参数的精细调节。然而,在线性赌博机等领域,是否存一种算法能在随机机制下取得 遗憾、在对抗机制下取得 遗憾,至今未知。本文肯定地解决了该问题,并给出了从两全其美到一大类跟随正则化领导者(FTRL)与在线镜像下降(OMD)算法的通用归约。我们通过将仅已知具最坏情况保证的现有算法,转化为在情境赌博机、图赌博机与表格马尔可夫决策过程中具两全其美保证的新算法,展示了该归约的能力。
引用
@article{arxiv.2302.09739,
title = {A Blackbox Approach to Best of Both Worlds in Bandits and Beyond},
author = {Christoph Dann and Chen-Yu Wei and Julian Zimmert},
journal= {arXiv preprint arXiv:2302.09739},
year = {2023}
}