中文

基于演化策略对深度强化学习策略进行精细调优:面向不完全受控机器人

机器人学 2025-07-15 v1

摘要

深度强化学习(Deep RL)已成为解决复杂控制问题的强大方法,尤其是针对不完全受控机器人系统。然而,在某些情况下,策略可能需要精细调优以实现与特定任务目标相匹配的最优性能和鲁棒性。在本文中,我们提出一种方法,通过演化策略(Evolutionary Strategies, ES)对深度RL策略进行精细调优,以提高不完全受控机器人的控制性能。我们的方法涉及使用拟合奖励函数设计的代理奖励函数训练RL智能体(采用Soft-Actor Critic, SAC),随后通过采用可分离自然演化策略(Separable Natural Evolution Strategy, SNES)的零阶优化步骤来精炼所学策略,直接针对原始评分进行优化。在2024年IROS AI赛事第二届的RealAIGym环境中进行的实验评估表明,我们的演化精炼显著提高了智能体性能,同时保持了高鲁棒性。所得控制器超过了既定基线,为赛事任务实现了竞争得分。

关键词

引用

@article{arxiv.2507.10030,
  title  = {Finetuning Deep Reinforcement Learning Policies with Evolutionary Strategies for Control of Underactuated Robots},
  author = {Marco Calì and Alberto Sinigaglia and Niccolò Turcato and Ruggero Carli and Gian Antonio Susto},
  journal= {arXiv preprint arXiv:2507.10030},
  year   = {2025}
}