轨道化: 大规模并行化的情景强化学习
机器人学
2024-05-21 v1
摘要
机器人控制的可能性通过深度强化学习的应用在 various 领域得到了扩展。为了克服安全和采样效率问题,深度强化学习模型可以在仿真环境中进行训练,从而实现更快的迭代周期。这可以通过使用 GPU 并行化训练过程来进一步增强。NVIDIA 的开源机器人学习框架 Orbit 通过为高并行性封装基于张量的强化学习库并基于 Isaac Sim 进行构建来利用这一潜力。我们为该框架实现的一个基准强化学习任务,即箱子推送,提供了详细的描述。此外,我们对该实现的性能进行了基准测试,与基于 CPU 的实现进行了比较,并报告了性能指标。最后,我们调整了该实现的超参数,表明我们可以通过 Orbit 在相同时间内生成显著更多的样本。
引用
@article{arxiv.2405.11512,
title = {Going into Orbit: Massively Parallelizing Episodic Reinforcement Learning},
author = {Jan Oberst and Johann Bonneau},
journal= {arXiv preprint arXiv:2405.11512},
year = {2024}
}