去偏模型无关元强化学习算法的收敛理论
机器学习
2021-11-18 v3 最优化与控制
机器学习
摘要
我们考虑用于强化学习(RL)问题的模型无关元学习(MAML)方法,其目标是通过若干由马尔可夫决策过程(MDP)表示的任务的数据找到一个策略,该策略可针对已实现 MDP 通过一步随机策略梯度进行更新。特别地,在 MAML 更新步骤中使用随机梯度对 RL 问题至关重要,因为精确梯度的计算需要访问大量可能的轨迹。针对该形式,我们提出了 MAML 方法的一个变体,称为随机梯度元强化学习(SG-MRL),并研究其收敛性质。我们推导了 SG-MRL 寻找 -一阶平稳点的迭代复杂度和样本复杂度,据我们所知,这提供了首个针对模型无关元强化学习算法的收敛保证。我们进一步展示了我们的结果如何推广到测试时使用多于一步随机策略梯度方法的情况。最后,我们在多个深度 RL 环境中对 SG-MRL 和 MAML 进行了实证比较。
引用
@article{arxiv.2002.05135,
title = {On the Convergence Theory of Debiased Model-Agnostic Meta-Reinforcement Learning},
author = {Alireza Fallah and Kristian Georgiev and Aryan Mokhtari and Asuman Ozdaglar},
journal= {arXiv preprint arXiv:2002.05135},
year = {2021}
}
备注
35th Conference on Neural Information Processing Systems (NeurIPS 2021)