SAPG: 分割聚合策略梯度
机器学习
2024-07-30 v1 人工智能
计算机视觉与模式识别
机器人学
系统与控制
系统与控制
摘要
尽管样本效率极差,但基于策略的强化学习(即策略梯度)已成为决策问题中的基本工具。近期GPU驱动的仿真进步使得能够指数级规模收集大量RL训练数据。然而,我们表明当前RL方法(例如PPO)在超出特定点的并行化环境中无法充分利用这些优势,其性能会饱和。为此,我们提出一种新型的on-policy RL算法,通过将环境分割成小块并通过重要性抽样将其重新聚合来有效利用大规模环境。我们称该算法为SAPG,在各种具有挑战性的环境中均表现出显著的高性能,其中vanilla PPO和其他强大基线无法实现高性能。网站地址为https://sapg-rl.github.io/
引用
@article{arxiv.2407.20230,
title = {SAPG: Split and Aggregate Policy Gradients},
author = {Jayesh Singla and Ananye Agarwal and Deepak Pathak},
journal= {arXiv preprint arXiv:2407.20230},
year = {2024}
}
备注
In ICML 2024 (Oral). Website at https://sapg-rl.github.io/