中文

奖励区域重放(R3):用于离散动作空间策略学习的算法

机器学习 2024-05-28 v1

摘要

我们引入了一种新的在策略算法,称为奖励区域重放(R3),该算法在解决具有离散动作空间的环境时显著改进了PPO。R3通过使用一个重放缓冲区来提高样本效率,该缓冲区包含过去奖励高于某个阈值的成功轨迹,这些轨迹通过重要性采样用于更新PPO智能体。关键的是,我们丢弃了高于某个比率的重要性采样因子,以减少方差并稳定训练。我们发现,在具有稀疏奖励和离散动作空间的Minigrid环境(如DoorKeyEnv和CrossingEnv)中,R3显著优于PPO,而且我们的方法相对于基线PPO的改进幅度随着环境复杂度的增加而增加。我们还将R3的性能与DDQN(双深度Q网络)进行了基准测试,DDQN是离散动作的离策略方法的标准基线,发现R3在DoorKeyEnv中也优于DDQN智能体。最后,我们将R3的思想应用于密集奖励设置,得到了密集R3算法(或DR3),并在Cartpole-V1环境中将其与PPO进行了基准测试。我们发现,DR3在这个密集奖励环境中显著优于PPO。我们的代码可在 https://github.com/chry-santhemum/R3 获取。

关键词

引用

@article{arxiv.2405.16383,
  title  = {Rewarded Region Replay (R3) for Policy Learning with Discrete Action Space},
  author = {Bangzheng Li and Ningshan Ma and Zifan Wang},
  journal= {arXiv preprint arXiv:2405.16383},
  year   = {2024}
}