中文

LISPR:一种用于强化学习中策略复用的选项框架

机器学习 2021-01-01 v1 人工智能

摘要

我们提出了一个将任何现有策略从潜在未知的源MDP迁移到目标MDP的框架。该框架(1)支持在目标域中复用任意形式的源策略,包括经典控制器、启发式策略或基于深度神经网络的策略,(2)在适当的理论条件下达到最优性,(3)保证在目标MDP中相对于源策略有所改进。这些通过将源策略封装为目标MDP中的黑盒选项,并提供通过通用值函数学习选项启动集的理论依据方法来实现。我们的方法通过(1)借助黑盒选项最大化目标MDP奖励,以及(2)将智能体返回到黑盒选项已学习启动集中其已是最优的状态,来促进新策略的学习。我们表明这两个变体在某些条件下性能等价。通过在模拟环境中的一系列实验,我们证明了我们的框架在给定(次)最优源策略的稀疏奖励问题中表现优异,并且在持续学习和渐进网络等缺乏我们框架理想理论性质的迁移方法上有所改进。

关键词

引用

@article{arxiv.2012.14942,
  title  = {LISPR: An Options Framework for Policy Reuse with Reinforcement Learning},
  author = {Daniel Graves and Jun Jin and Jun Luo},
  journal= {arXiv preprint arXiv:2012.14942},
  year   = {2021}
}