中文

结构化强化学习中的探索

机器学习 2018-11-30 v2 机器学习

摘要

我们研究具有有限状态和动作空间的强化学习问题,其中底层 MDP 具有某些已知结构,可潜在用于最小化次优(状态,动作)对的探索率。针对任意结构,我们推导了任何学习算法均须满足的问题相关后悔下界。这些下界对于无结构 MDP 以及转移概率和平均奖励函数关于状态和动作为 Lipschitz 连续的 MDP 被显式给出。对于 Lipschitz MDP,该下界不随状态空间大小 SS 和动作空间大小 AA 而增长,即小于 clogTc\log T,其中 TT 为时间范围,常数 cc 仅依赖于 Lipschitz 结构、偏置函数的跨度以及最小动作次优间隙。这与无结构 MDP 形成对比,后者的后悔下界通常随 SAlogTSA\log T 增长。我们设计了 DEL(有向探索学习)算法,该算法与我们的后悔下界相匹配。我们进一步为 Lipschitz MDP 简化了该算法,并表明简化版本仍能有效利用结构。

关键词

引用

@article{arxiv.1806.00775,
  title  = {Exploration in Structured Reinforcement Learning},
  author = {Jungseul Ok and Alexandre Proutiere and Damianos Tranos},
  journal= {arXiv preprint arXiv:1806.00775},
  year   = {2018}
}