面向元强化学习的性能加权策略采样
机器学习
2020-12-14 v1 系统与控制
系统与控制
摘要
本文讨论一种增强型模型无关元学习(E-MAML)算法,其在应用于新学习任务时能从少量训练样本实现策略函数的快速收敛。E-MAML 构建于模型无关元学习(MAML)之上,维护一组在环境中针对先前任务学习到的策略参数。我们将 E-MAML 应用于开发动态系统基于强化学习(RL)的在线容错控制方案。当发生新故障时应用该增强方法,重新初始化新 RL 策略的参数,从而利用少量新故障下系统行为样本实现更快适应。这替代了 MAML 中的随机任务采样步骤,转而利用控制器已生成的既往经验。该增强以最大化参数空间跨度的方式采样,以促进对新故障的适应。我们在著名的 cart pole 示例以及某飞机燃油传输系统上,展示了将 E-MAML 与近端策略优化(PPO)结合的性能。
引用
@article{arxiv.2012.06016,
title = {Performance-Weighed Policy Sampling for Meta-Reinforcement Learning},
author = {Ibrahim Ahmed and Marcos Quinones-Grueiro and Gautam Biswas},
journal= {arXiv preprint arXiv:2012.06016},
year = {2020}
}