中文

基于多级蒙特卡洛 actor-critic 的平均奖励强化学习中超越指数快速混合的方法

机器学习 2023-02-02 v2 最优化与控制 机器学习

摘要

许多现有的强化学习(RL)方法在后端采用随机梯度迭代,其稳定性依赖于一个假设:数据生成过程以指数速度混合,且步长选择中出现一个速率参数。遗憾的是,对于大状态空间或稀疏奖励设置,该假设不成立,且混合时间未知,使得步长无法使用。在本工作中,我们提出了一种适应混合时间的 RL 方法,通过在 actor-critic(AC)算法中嵌入针对评论家、行动者和平均奖励的多级蒙特卡洛估计器。我们将该方法称为多级 Actor-Critic(MAC),它专为无限 horizon 平均奖励设置而开发,在其参数选择中既不依赖混合时间的预言知识,也不假设其指数衰减;因此,它可随时应用于具有较慢混合时间的场景。尽管如此,它达到了与最先进 AC 算法相当的收敛速率。我们通过实验表明,这些对稳定性所需技术条件的放宽,在实践中转化为稀疏奖励 RL 问题的更优性能。

关键词

引用

@article{arxiv.2301.12083,
  title  = {Beyond Exponentially Fast Mixing in Average-Reward Reinforcement Learning via Multi-Level Monte Carlo Actor-Critic},
  author = {Wesley A. Suttle and Amrit Singh Bedi and Bhrij Patel and Brian M. Sadler and Alec Koppel and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2301.12083},
  year   = {2023}
}