强化学习比上下文赌博机更难吗?一种逃离视界诅咒的近最优算法
机器学习
2021-07-01 v2 机器学习
摘要
情景式强化学习与上下文赌博机是两种被广泛研究的序列决策问题。情景式强化学习是上下文赌博机的推广,且常被认为因较长的规划视界与未知的状态相关转移而更为困难。本文表明,较长的规划视界与未知的状态相关转移(至多)在样本复杂度上带来的额外困难很小。我们考虑具有 个状态、 个动作、规划视界 、总奖励以 为界、智能体进行 个情景的情景式强化学习。我们提出一种新算法,单调价值传播(MVP),其依赖于一种新的 Bernstein 型奖励项。与已有的奖励项构造相比,新奖励项更紧,因为它基于一个精心设计的单调价值函数。特别地,奖励项中的常数需被精细设置以保证乐观性与单调性。我们证明 MVP 具有 的遗憾值,在对数项意义上逼近上下文赌博机的 下界。值得注意的是,该结果 1) 在关于 的依赖性上,相对于 Dann 等人 [2019] 与 Zanette 等人 [2019] 的最先进多项式时间算法有指数级改进;2) 相对于 [Wang et al. 2020] 在运行时间上有指数级改进,并在样本复杂度上显著改进了对 、 和 的依赖性。
引用
@article{arxiv.2009.13503,
title = {Is Reinforcement Learning More Difficult Than Bandits? A Near-optimal Algorithm Escaping the Curse of Horizon},
author = {Zihan Zhang and Xiangyang Ji and Simon S. Du},
journal= {arXiv preprint arXiv:2009.13503},
year = {2021}
}