中文

非平稳任务与博弈中连续动作强化学习的统一策略优化

机器学习 2022-08-22 v1

摘要

本文研究具有连续动作的非平稳环境与博弈中的策略学习。受跟随正则化领导者(FTRL)与镜像下降(MD)更新思想的启发,而非经典的奖励最大化机制,我们提出一种无遗憾风格的连续动作任务强化学习算法 PORL。我们证明 PORL 具有末次迭代收敛保证,这对于对抗性与合作性博弈十分重要。实证研究表明,在 MuJoCo 运动控制任务等平稳环境中,PORL 表现与软 actor-critic(SAC)算法相当甚至更优;在包含动态环境、对抗训练与竞争博弈的非平稳环境中,PORL 在更优的最终策略性能与更稳定的训练过程两方面均优于 SAC。

关键词

引用

@article{arxiv.2208.09452,
  title  = {Unified Policy Optimization for Continuous-action Reinforcement Learning in Non-stationary Tasks and Games},
  author = {Rong-Jun Qin and Fan-Ming Luo and Hong Qian and Yang Yu},
  journal= {arXiv preprint arXiv:2208.09452},
  year   = {2022}
}