基于策略草图的模块化多任务强化学习
机器学习
2017-06-20 v2 神经与进化计算
摘要
我们描述了一种由策略草图引导的多任务深度强化学习框架。草图用命名子任务的序列来标注任务,提供关于任务间高层结构关系的信息,但不提供如何实现它们的方法——具体而言,不提供许多先前关于强化学习(RL)策略抽象学习工作所使用的详细指导(例如中间奖励、子任务完成信号或内在动机)。为了从草图学习,我们提出一种模型,将每个子任务与模块化子策略相关联,并通过在共享子策略间绑定参数,联合最大化完整任务特定策略上的奖励。优化通过解耦的 actor-critic 训练目标实现,该目标有助于从多个不同的奖励函数中学习共同行为。我们在三个包含离散与连续控制、且仅有在完成若干高层子目标后才能获得稀疏奖励的环境中评估了方法的有效性。实验表明,使用我们的方法学习由草图引导的策略,比现有的学习任务特定或共享策略的技术性能更好,同时自然地归纳出一个可解释的基本行为库,这些行为可重新组合以快速适应新任务。
引用
@article{arxiv.1611.01796,
title = {Modular Multitask Reinforcement Learning with Policy Sketches},
author = {Jacob Andreas and Dan Klein and Sergey Levine},
journal= {arXiv preprint arXiv:1611.01796},
year = {2017}
}
备注
To appear at ICML 2017