中文

基于深度混合专家在强化学习领域中的上下文策略迁移

机器学习 2020-06-11 v2 神经与进化计算 机器人学 系统与控制 系统与控制

摘要

在强化学习中,在选择用于迁移的源策略时考虑上下文或当前状态的智能体已被证明优于与上下文无关的方法。然而,现有方法均未能从基于模型的 learner 向无模型的 learner 进行上下文知识迁移。这可能有用,例如,当源策略有意在具有充足数据的多样仿真上学习但迁移到数据有限的真实世界设定时。在本文中,我们假设已知估计的源任务动态与策略,以及共同子目标但不同动态。我们引入一种新颖的深度混合专家公式,用于学习对匹配目标动态的源任务动态的状态依赖信念,使用从目标任务收集的状态轨迹。该混合模型易于解释,对动态中的估计误差表现出鲁棒性,且与多数学习算法兼容。随后我们展示该模型如何被纳入标准策略复用框架,并证明其在 OpenAI-Gym 基准上的有效性。

关键词

引用

@article{arxiv.2003.00203,
  title  = {Contextual Policy Transfer in Reinforcement Learning Domains via Deep Mixtures-of-Experts},
  author = {Michael Gimelfarb and Scott Sanner and Chi-Guhn Lee},
  journal= {arXiv preprint arXiv:2003.00203},
  year   = {2020}
}

备注

- updated experiment for Lander domain (fixed a bug in the UCB baseline) - minor editing and formatting, fixing typos - new template - 15 pages, 6 figures