中文

利用自适应势函数提升连续机器人到达任务中的强化学习算法

机器人学 2024-02-08 v1

摘要

在强化学习中,奖励塑造是引导智能体学习过程的有效方式,因为奖励可以指示任务的最优策略。基于势的奖励塑造框架被提出用于保证奖励塑造后的策略不变性,其中使用势函数来计算塑造奖励。在先前的工作中,我们提出了一种新颖的自适应势函数(APF)方法,基于智能体在训练过程中收集的信息,在训练智能体的同时学习势函数,并在离散动作空间场景中检验了APF方法。本文研究了在具有连续动作空间的真实世界机器人场景中,使用APF解决连续到达任务的可行性。我们将深度确定性策略梯度(DDPG)算法与我们提出的方法相结合,形成了一种名为APF-DDPG的新算法。为了比较APF-DDPG与DDPG,我们设计了一个任务,其中智能体学习控制Baxter的右臂到达目标位置。实验结果表明,APF-DDPG算法在学习速度和鲁棒性方面均优于DDPG算法。

关键词

引用

@article{arxiv.2402.04581,
  title  = {Boosting Reinforcement Learning Algorithms in Continuous Robotic Reaching Tasks using Adaptive Potential Functions},
  author = {Yifei Chen and Lambert Schomaker and Francisco Cruz},
  journal= {arXiv preprint arXiv:2402.04581},
  year   = {2024}
}

备注

7 pages, 6 figures