中文

上下文强化学习中的无后悔探索

机器学习 2020-06-19 v3 人工智能 机器学习

摘要

我们考虑最近提出的上下文马尔可夫决策过程(CMDP)的强化学习(RL)框架,其中智能体与一系列(可能是对抗性的)情景式表格 MDP 交互。此外,决定 MDP 参数的上下文向量在每幕开始时对智能体可用,从而允许其学习依赖于上下文的近最优策略。在本文中,我们针对 MDP 参数通过广义线性映射(GLMs)从上下文获得的情况,提出一种无后悔的在线 RL 算法。我们提出并分析了乐观和随机化探索方法,其进行(时间和空间)高效的在线更新。基于 GLM 的模型包含了该领域先前的工作,并在上下文映射为线性的特殊情况下改进了先前已知的界。此外,我们展示了一个利用在线学习预言机推导置信集的通用模板,并给出了该设置下的一个下界。

关键词

引用

@article{arxiv.1903.06187,
  title  = {No-regret Exploration in Contextual Reinforcement Learning},
  author = {Aditya Modi and Ambuj Tewari},
  journal= {arXiv preprint arXiv:1903.06187},
  year   = {2020}
}

备注

Accepted to UAI 2020. PMLR proceedings, volume 124