多步贪婪强化学习算法
机器学习
2020-07-14 v3 机器学习
摘要
多步贪婪策略已在基于模型的强化学习(RL)中得到广泛使用,无论是在环境模型可用时(例如围棋游戏)还是在学习得到模型时。在本文中,我们探索了它们在无模型 RL 中通过多步动态规划算法使用时的优势:-策略迭代(-PI)和 -值迭代(-VI)。这些方法通过求解具有整形奖励和较小折扣因子的代理决策问题,迭代地计算下一策略(-PI)和值函数(-VI)。我们基于 -PI 和 -VI 推导了无模型 RL 算法,其中代理问题可由任何离散或连续动作 RL 方法求解,例如 DQN 和 TRPO。我们指出了控制代理问题求解程度的一个超参数的重要性,并提出了一种设置该参数的方法。当在一系列 Atari 和 MuJoCo 基准任务上评估时,我们的结果表明,在合适的 范围内,我们的算法优于 DQN 和 TRPO。这表明我们的多步贪婪算法具有足够的通用性,可应用于任何现有 RL 算法之上,并能显著提升其性能。
引用
@article{arxiv.1910.02919,
title = {Multi-step Greedy Reinforcement Learning Algorithms},
author = {Manan Tomar and Yonathan Efroni and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:1910.02919},
year = {2020}
}
备注
ICML 2020