中文

基于信赖域方法的平均奖励强化学习

机器学习 2021-11-02 v2 人工智能

摘要

大多数强化学习算法优化折扣准则,这有利于加速收敛并降低估计方差。尽管折扣准则适用于某些任务(如金融相关问题),许多工程问题平等对待未来奖励并偏好长程平均准则。本文研究长程平均准则下的强化学习问题。首先,我们建立了涵盖折扣与平均准则的统一信赖域理论,并借助扰动分析(PA)理论推导了信赖域内新的性能界。其次,我们提出一种实用算法,称为平均策略优化(APO),其通过一种称为平均价值约束的新技术改进价值估计。最后,在连续控制环境 MuJoCo 中进行了实验。在大多数任务中,APO 表现优于折扣 PPO,证明了我们方法的有效性。我们的工作提供了包含折扣与平均准则的信赖域方法的统一框架,可补充超越折扣目标的强化学习框架。

关键词

引用

@article{arxiv.2106.03442,
  title  = {Average-Reward Reinforcement Learning with Trust Region Methods},
  author = {Xiaoteng Ma and Xiaohang Tang and Li Xia and Jun Yang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2106.03442},
  year   = {2021}
}

备注

Accepted by IJCAI2021