中文

PACER:一种完全基于前向推送的分布强化学习算法

机器学习 2024-10-10 v2

摘要

本文提出首个完全基于前向推送(push-forward)的分布强化学习算法,称为 PACER,其由一个分布评论家、一个随机行动者以及一个基于样本的激励器组成。具体而言,评论家与行动者均利用前向推送算子分别建模回报分布与随机策略,使二者具备同等的建模能力,从而提升协同性能。由于无法获得前向推送策略的密度函数,激励器中集成了新颖的基于样本的正则化项,以激励高效探索并缓解陷入局部最优的风险。此外,我们建立了基于样本的随机效用值策略梯度用于前向推送策略更新,规避了现有基于 REINFORCE 的随机策略梯度对策略密度函数的显式需求。因此,与现有分布行动者-评论家算法(如高斯类)所用的有限策略类相比,PACER 充分利用了前向推送算子的建模能力,并能探索更广的策略空间类。我们通过大量实证研究所验证了算法中各组件的关键作用。实验结果证明了本算法相对于当前最优方法的优越性。

关键词

引用

@article{arxiv.2306.06637,
  title  = {PACER: A Fully Push-forward-based Distributional Reinforcement Learning Algorithm},
  author = {Wensong Bai and Chao Zhang and Yichao Fu and Peilin Zhao and Hui Qian and Bin Dai},
  journal= {arXiv preprint arXiv:2306.06637},
  year   = {2024}
}