中文

MOSEAC:简化可变时间步长强化学习

机器学习 2024-06-04 v1 机器人学

摘要

传统的强化学习 (RL) 方法通常采用固定控制循环,其中每个循环对应一个动作。这种刚性方法在实际应用中存在挑战,因为最优控制频率取决于具体任务。次优的选择会导致高计算开销和探索效率下降。可变时间步长强化学习 (VTS-RL) 通过为控制循环采用自适应频率,在必要时才执行动作,以解决上述问题。该方法根植于响应式编程原则,减少了计算负担,并通过包含动作持续时间来扩展动作空间。然而,VTS-RL 的实现常因需要调谋多个控制探索的超参数而复杂,这些超参数 govern 于多目标动作-持续时间空间(即在任务性能与实现目标所需时间步数之间进行平衡)。为克服这些挑战,我们引入了多目标软弹性演员-评论家 (MOSEAC) 方法。该方法具备一种自适应奖励方案,根据训练期间观察到的任务奖励趋势自动调整超参数。该方案简化了超参数调谋流程,只需一个超参数来指导探索,从而降低了学习过程的复杂性并降低了部署成本。我们通过牛顿运动学环境中的仿真实验验证了 MOSEAC 方法,展示了其在更少时间步数下的高任务和训练性能,从而降低了能源消耗。该验证表明,MOSEAC 通过使用单个参数自动调节智能体控制循环频率,简化了 RL 算法的部署。其原理可应用于提升任何 RL 算法的性能,因而是一种通用且具备多样化应用潜力的解决方案。

关键词

引用

@article{arxiv.2406.01521,
  title  = {MOSEAC: Streamlined Variable Time Step Reinforcement Learning},
  author = {Dong Wang and Giovanni Beltrame},
  journal= {arXiv preprint arXiv:2406.01521},
  year   = {2024}
}