中文

一类用于稳定高效强化学习的通用代理函数

机器学习 2023-11-01 v5 人工智能 机器学习

摘要

常见的策略梯度方法依赖于对一系列代理函数的最大化。近年来提出了许多此类代理函数,大多缺乏强有力的理论保证,从而产生了TRPO、PPO或MPO等算法。我们不是设计又一个代理函数,而是提出了一个基于函数镜像上升的通用框架(FMA-PG),由此产生一整个代理函数族。我们构造的代理函数能够实现策略改进保证,这是大多数现有代理函数所不具备的性质。关键在于,无论策略参数化如何选择,这些保证均成立。此外,FMA-PG的一个特定实例恢复了重要的实现启发式方法(例如,使用前向与反向KL散度),从而得到具有额外理想性质的TRPO变体。通过在简单bandit问题上的实验,我们评估了由FMA-PG实例化的算法。所提出的框架还给出了一种改进的PPO变体,我们在MuJoCo套件上通过实验证明了其鲁棒性和效率。

关键词

引用

@article{arxiv.2108.05828,
  title  = {A general class of surrogate functions for stable and efficient reinforcement learning},
  author = {Sharan Vaswani and Olivier Bachem and Simone Totaro and Robert Mueller and Shivam Garg and Matthieu Geist and Marlos C. Machado and Pablo Samuel Castro and Nicolas Le Roux},
  journal= {arXiv preprint arXiv:2108.05828},
  year   = {2023}
}

备注

Fixed minor typos