无先验知识的非平稳强化学习:一种最优黑盒方法
机器学习
2021-09-07 v3 人工智能
机器学习
摘要
我们提出了一种黑盒归约,可将某类在(近)平稳环境中具有最优regret的强化学习算法转化为另一种在非平稳环境中具有最优动态regret的算法,关键在于无需任何关于非平稳程度的先验知识。通过将不同算法代入我们的黑盒,我们给出了一系列示例表明,我们的方法不仅恢复了近期由高度专门化算法在(上下文)多臂老虎机中取得的成果,还在多个方面显著改进了(广义)线性老虎机、情节式MDP以及无限 horizon MDP的当前最优水平。具体而言,在大多数情况下,我们的算法达到了最优动态regret ,其中为轮数,和分别为世界变化的次数与变化量,而先前工作仅获得次优界和/或需要已知与。
引用
@article{arxiv.2102.05406,
title = {Non-stationary Reinforcement Learning without Prior Knowledge: An Optimal Black-box Approach},
author = {Chen-Yu Wei and Haipeng Luo},
journal= {arXiv preprint arXiv:2102.05406},
year = {2021}
}