非平稳任务与博弈中连续动作强化学习的统一策略优化
机器学习
2022-08-22 v1
摘要
本文研究具有连续动作的非平稳环境与博弈中的策略学习。受跟随正则化领导者(FTRL)与镜像下降(MD)更新思想的启发,而非经典的奖励最大化机制,我们提出一种无遗憾风格的连续动作任务强化学习算法 PORL。我们证明 PORL 具有末次迭代收敛保证,这对于对抗性与合作性博弈十分重要。实证研究表明,在 MuJoCo 运动控制任务等平稳环境中,PORL 表现与软 actor-critic(SAC)算法相当甚至更优;在包含动态环境、对抗训练与竞争博弈的非平稳环境中,PORL 在更优的最终策略性能与更稳定的训练过程两方面均优于 SAC。
引用
@article{arxiv.2208.09452,
title = {Unified Policy Optimization for Continuous-action Reinforcement Learning in Non-stationary Tasks and Games},
author = {Rong-Jun Qin and Fan-Ming Luo and Hong Qian and Yang Yu},
journal= {arXiv preprint arXiv:2208.09452},
year = {2022}
}