非平稳强化学习:更多乐观带来的裨益
机器学习
2020-05-19 v4 机器学习
摘要
我们考虑在时序漂移下的马尔可夫决策过程(MDPs)中进行无折扣强化学习(RL),即只要奖励和状态转移分布各自的某种度量下的总变差不超过特定变差预算,就允许它们随时间演化。该设定刻画了序贯决策场景中的内生性、外生性、不确定性与部分反馈,并在车辆再营销与实时竞价中有应用。我们首先开发了带置信拓宽的滑动窗口上置信界强化学习(SWUCRL2-CW)算法,并在变差预算已知时建立了其动态后悔界。此外,我们提出强化学习上的Bandit(BORL)算法,以自适应地调节SWUCRL2-CW算法,在无需知道变差预算的无参数方式下实现相同的动态后悔界。最后,我们进行了数值实验,表明所提算法相比现有算法具有更优的实证性能。值得注意的是,当我们将传统的面对不确定性保持乐观原则应用于漂移MDP中的RL以设计具有可证明低动态后悔的算法时,内生性与外生性之间的相互作用带来了现有(平稳与非平稳)随机在线学习设定中所没有的独特挑战。我们通过一种新颖的置信拓宽技术克服了该挑战,该技术将额外的乐观引入学习算法以确保低动态后悔界。为扩展理论发现,我们将框架应用于库存控制问题,并展示了如何替代性地利用状态转移分布上的特殊结构来规避时变环境中的探索困难。
引用
@article{arxiv.1906.02922,
title = {Non-Stationary Reinforcement Learning: The Blessing of (More) Optimism},
author = {Wang Chi Cheung and David Simchi-Levi and Ruihao Zhu},
journal= {arXiv preprint arXiv:1906.02922},
year = {2020}
}