中文

兼容神经网络的离策略自然行动者-评论者算法

机器学习 2022-06-16 v3 人工智能

摘要

从已有数据中学习最优行为是强化学习(RL)中最重要的问题之一。这在RL中被称为“离策略控制”,其中智能体的目标是基于给定策略(称为行为策略)获得的数据计算最优策略。由于最优策略可能与行为策略非常不同,与“在策略”设定(其中来自策略更新的新数据将被用于学习)相比,在“离策略”设定下学习最优行为非常困难。本工作提出了一种离策略自然行动者-评论者算法,该算法利用状态-动作分布校正来处理离策略行为,并利用自然策略梯度以提升样本效率。现有具有收敛保证的基于自然梯度的行动者-评论者算法需要固定特征来逼近策略与值函数,这常导致许多RL应用中的次优学习。另一方面,我们提出的算法利用兼容特征,使得人们可以使用任意神经网络来逼近策略与值函数,并保证收敛到局部最优策略。我们通过在基准RL任务上将其与朴素梯度行动者-评论者算法比较,阐明了所提离策略自然梯度算法的益处。

关键词

引用

@article{arxiv.2110.10017,
  title  = {Neural Network Compatible Off-Policy Natural Actor-Critic Algorithm},
  author = {Raghuram Bharadwaj Diddigi and Prateek Jain and Prabuchandran K. J. and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:2110.10017},
  year   = {2022}
}

备注

This paper has been accepted for presentation at the IJCNN at IEEE WCCI 2022 and for publication in the conference proceedings published by IEEE