中文

Lipschitz 终身强化学习

机器学习 2021-03-23 v3 人工智能 机器学习

摘要

我们考虑智能体面对一系列强化学习(RL)任务时的知识迁移问题。我们引入马尔可夫决策过程(MDPs)间的一种新度量,并确立相近的 MDP 具有相近的最优值函数。形式上,最优值函数关于任务空间是 Lipschitz 连续的。这些理论结果引导出一种用于终身 RL 的值迁移方法,我们借此构建了一种具有改进收敛速率的 PAC-MDP 算法。进一步,我们表明该方法以高概率不经历负迁移。我们在终身 RL 实验中展示了该方法的益处。

关键词

引用

@article{arxiv.2001.05411,
  title  = {Lipschitz Lifelong Reinforcement Learning},
  author = {Erwan Lecarpentier and David Abel and Kavosh Asadi and Yuu Jinnai and Emmanuel Rachelson and Michael L. Littman},
  journal= {arXiv preprint arXiv:2001.05411},
  year   = {2021}
}

备注

In proceedings of the 35th AAAI Conference on Artificial Intelligence (AAAI 2021), 21 pages, 11 figures