面向平均奖励准则的 On-Policy 深度强化学习
机器学习
2021-06-15 v1 人工智能
机器学习
摘要
我们开发了平均奖励 on-policy 强化学习(RL)的理论与算法。我们首先考虑界定两种策略长期平均奖励的差异。我们指出,以往基于折扣回报的工作(Schulman 等,2015;Achiam 等,2017)在平均奖励设定下会导致无意义的界。通过直接处理平均奖励准则,我们进而推导出一个依赖于两策略间平均散度与 Kemeny 常数的新界。基于此界,我们开发了一种迭代过程,可生成平均奖励准则下单调改进的策略序列。该迭代过程随后可与经典 DRL(深度强化学习)方法结合,得到面向长期平均奖励准则的实用 DRL 算法。特别地,我们证明将 on-policy TRPO 算法适配于平均奖励准则的 Average-Reward TRPO(ATRPO)在最具挑战性的 MuJuCo 环境中显著优于 TRPO。
引用
@article{arxiv.2106.07329,
title = {On-Policy Deep Reinforcement Learning for the Average-Reward Criterion},
author = {Yiming Zhang and Keith W. Ross},
journal= {arXiv preprint arXiv:2106.07329},
year = {2021}
}
备注
International Conference on Machine Learning (ICML) 2021