中文

基于GPU加速仿真跨机器人任务的种群强化学习基准测试

机器人学 2025-11-19 v5

摘要

近年来,深度强化学习(RL)在解决复杂连续控制任务中展现了其有效性。然而,这是以训练所需的大量经验为代价的,且学习效率和策略性能对超参数选择的敏感性使这一问题更加严重,这通常需要大量耗时的实验试错。本研究利用基于种群的强化学习(PBRL)方法和GPU加速的物理模拟器,通过并行同时训练多个策略来增强RL的探索能力。该PBRL框架与三种最先进的RL算法——PPO、SAC和DDPG——进行了基准比较,根据学习智能体的性能动态调整超参数。实验在Isaac Gym中的四个挑战性任务上进行——Anymal Terrain、Shadow Hand、Humanoid和Franka Nut Pick——通过分析种群规模和超参数变异机制的影响。结果表明,在累积奖励方面,PBRL智能体实现了优于非进化基线智能体的性能。此外,训练好的智能体最终被部署到真实世界的Franka Nut Pick任务中。据我们所知,这是首次将PBRL智能体部署到真实硬件的sim-to-real尝试。学习策略的代码和视频可在我们的项目网站(https://sites.google.com/view/pbrl)上获取。

关键词

引用

@article{arxiv.2404.03336,
  title  = {Benchmarking Population-Based Reinforcement Learning across Robotic Tasks with GPU-Accelerated Simulation},
  author = {Asad Ali Shahid and Yashraj Narang and Vincenzo Petrone and Enrico Ferrentino and Ankur Handa and Dieter Fox and Marco Pavone and Loris Roveda},
  journal= {arXiv preprint arXiv:2404.03336},
  year   = {2025}
}

备注

Accepted for publication at 2025 IEEE 21st International Conference on Automation Science and Engineering