中文

基于树结构 Parzen 估计器优化深度强化学习用于自适应机器人臂控制

机器人学 2025-11-27 v1 人工智能

摘要

本文探讨了如何使用树结构 Parzen 估计器 (TPE) 对 Soft Actor-Critic (SAC) 和 Proximal Policy Optimization (PPO) 算法的超参数进行优化,以实现七自由度 (DOF) 机器人臂控制中的自适应控制。我们的结果表明,算法性能得到显著提升,TPE 将 SAC 的成功率提高了 10.48 个百分点,将 PPO 的成功率提高了 34.28 个百分点,其中训练 5 万个 episode。此外,TPE 使 PPO 能够比不使用 TPE 时快 76% 收敛到奖励的 95% 以下,这相当于需要约 4 万 个 episode 的训练才能实现最佳性能。对于 SAC 来说,这一改进比不使用 TPE 时快 80%。本研究强调了先进超参数优化对复杂机器人任务中深度强化学习算法效率和成功率的重要影响。

关键词

引用

@article{arxiv.2407.02503,
  title  = {Optimizing Deep Reinforcement Learning for Adaptive Robotic Arm Control},
  author = {Jonaid Shianifar and Michael Schukat and Karl Mason},
  journal= {arXiv preprint arXiv:2407.02503},
  year   = {2025}
}