Lipschitz 终身强化学习
机器学习
2021-03-23 v3 人工智能
机器学习
摘要
我们考虑智能体面对一系列强化学习(RL)任务时的知识迁移问题。我们引入马尔可夫决策过程(MDPs)间的一种新度量,并确立相近的 MDP 具有相近的最优值函数。形式上,最优值函数关于任务空间是 Lipschitz 连续的。这些理论结果引导出一种用于终身 RL 的值迁移方法,我们借此构建了一种具有改进收敛速率的 PAC-MDP 算法。进一步,我们表明该方法以高概率不经历负迁移。我们在终身 RL 实验中展示了该方法的益处。
引用
@article{arxiv.2001.05411,
title = {Lipschitz Lifelong Reinforcement Learning},
author = {Erwan Lecarpentier and David Abel and Kavosh Asadi and Yuu Jinnai and Emmanuel Rachelson and Michael L. Littman},
journal= {arXiv preprint arXiv:2001.05411},
year = {2021}
}
备注
In proceedings of the 35th AAAI Conference on Artificial Intelligence (AAAI 2021), 21 pages, 11 figures