中文

通过 DreamerV3 技巧实现近端策略优化的奖励尺度鲁棒性

机器学习 2023-10-30 v1 人工智能

摘要

大多数强化学习方法严重依赖稠密、良好归一化的环境奖励。DreamerV3 近期提出了一种基于模型的方法,带有若干缓解这些局限性的技巧,以单一超参数集在广泛基准上达到最先进水平(SOTA)。该结果引发了对这些技巧通用性的讨论,因其似乎可应用于其他强化学习算法。我们的工作将 DreamerV3 的技巧应用于 PPO,且是原始工作之外的首个此类实证研究。令人惊讶的是,我们发现所提出的技巧并未作为通用改进迁移到 PPO。我们使用高质量的 PPO 参考实现,并在 Arcade Learning Environment 和 DeepMind Control Suite 上呈现了总计超过 10,000 A100 小时的广泛消融研究。尽管我们的实验表明这些技巧并未普遍优于 PPO,我们识别出了其成功的情形,并提供了关于实现技巧间关系的见解。特别地,带这些技巧的 PPO 在具有奖励截断的 Atari 游戏上表现与 PPO 相当,并显著优于无奖励截断的 PPO。

关键词

引用

@article{arxiv.2310.17805,
  title  = {Reward Scale Robustness for Proximal Policy Optimization via DreamerV3 Tricks},
  author = {Ryan Sullivan and Akarsh Kumar and Shengyi Huang and John P. Dickerson and Joseph Suarez},
  journal= {arXiv preprint arXiv:2310.17805},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023