中文

通过强化学习调节储备池动力学以实现高效的机器人技能合成

机器人学 2024-11-19 v1 人工智能

摘要

一种称为储备池的随机循环神经网络可用于学习以编码任务目标的上下文输入为条件的机器人运动。这种学习是通过线性回归将受上下文调节的储备池随机动力学映射到期望轨迹来实现的。这使得储备池计算(RC)方法在计算上非常高效,因为不需要迭代的梯度下降学习。在本工作中,我们提出了一种新颖的基于 RC 的从演示中学习框架,它不仅学习生成演示的运动,还允许在线调节储备池动力学以生成初始演示集未涵盖的运动轨迹。这是通过使用强化学习(RL)模块来实现的,该模块学习一个策略,以基于机器人状态输出上下文作为其动作。考虑到上下文维度通常较低,使用 RL 模块进行学习非常高效。我们通过在 2 自由度(DOF)模拟机器人上的系统实验验证了所提出模型的有效性,该机器人被教导去到达编码为上下文的目标,包含和不包含避障约束。初始数据集包括一组到达演示,由储备池系统学习。为了能够到达分布外目标,RL 模块参与学习一个策略以生成动态上下文,使得生成的轨迹能够在储备池系统无需任何学习的情况下实现期望目标。总体而言,所提出的模型使用初始学习到的运动基元集,在设计的奖励函数引导下高效生成多样的运动行为。因此,该模型可作为一个灵活有效的 LfD 系统,无需收集新数据即可扩展动作库。

关键词

引用

@article{arxiv.2411.10991,
  title  = {Modulating Reservoir Dynamics via Reinforcement Learning for Efficient Robot Skill Synthesis},
  author = {Zahra Koulaeizadeh and Erhan Oztop},
  journal= {arXiv preprint arXiv:2411.10991},
  year   = {2024}
}

备注

13 pages, 7 figures