不变策略优化:迈向强化学习中更强的泛化
机器学习
2020-11-10 v3 人工智能
机器人学
机器学习
摘要
强化学习中的一个基本挑战是学习在训练期间所经历的操作域之外泛化的策略。在本文中,我们通过以下不变性原理应对这一挑战:智能体必须找到一个表示,使得在该表示之上构建的动作预测器在所有训练域上同时最优。直观上,由此产生的不变策略通过寻找成功动作的原因来增强泛化。我们提出了一种新颖的学习算法,不变策略优化(IPO),该算法实现此原理并在训练期间学习不变策略。我们将我们的方法与标准策略梯度方法进行比较,并在线性二次调节器和网格世界问题的未见域上,以及一个机器人必须学习打开具有不同物理属性门的示例中,展示了泛化性能的显著提升。
引用
@article{arxiv.2006.01096,
title = {Invariant Policy Optimization: Towards Stronger Generalization in Reinforcement Learning},
author = {Anoopkumar Sonar and Vincent Pacelli and Anirudha Majumdar},
journal= {arXiv preprint arXiv:2006.01096},
year = {2020}
}
备注
16 pages, 4 figures