结构化强化学习中的探索
机器学习
2018-11-30 v2 机器学习
摘要
我们研究具有有限状态和动作空间的强化学习问题,其中底层 MDP 具有某些已知结构,可潜在用于最小化次优(状态,动作)对的探索率。针对任意结构,我们推导了任何学习算法均须满足的问题相关后悔下界。这些下界对于无结构 MDP 以及转移概率和平均奖励函数关于状态和动作为 Lipschitz 连续的 MDP 被显式给出。对于 Lipschitz MDP,该下界不随状态空间大小 和动作空间大小 而增长,即小于 ,其中 为时间范围,常数 仅依赖于 Lipschitz 结构、偏置函数的跨度以及最小动作次优间隙。这与无结构 MDP 形成对比,后者的后悔下界通常随 增长。我们设计了 DEL(有向探索学习)算法,该算法与我们的后悔下界相匹配。我们进一步为 Lipschitz MDP 简化了该算法,并表明简化版本仍能有效利用结构。
引用
@article{arxiv.1806.00775,
title = {Exploration in Structured Reinforcement Learning},
author = {Jungseul Ok and Alexandre Proutiere and Damianos Tranos},
journal= {arXiv preprint arXiv:1806.00775},
year = {2018}
}