中文

基于路径点的强化学习用于机器人操作任务

机器人学 2024-03-21 v1

摘要

机械臂应当能够学习新任务。一种可行的框架是强化学习,其中机器人被赋予一个编码任务的奖励函数,并自主学习动作以最大化其奖励。现有的强化学习方法通常将这一问题建模为马尔可夫决策过程,并学习一个策略(或策略层级)来完成任务。这些策略针对机械臂需要执行的成百上千个细粒度动作进行推理,例如:稍微向右移动或将末端执行器旋转几度。但我们希望机器人执行的操作任务通常可以被分解为少量高层运动,例如:接近物体或转动把手。因此,本文提出一种基于路径点的无模型强化学习方法。机器人不再学习底层策略,而是学习一条由路径点构成的轨迹,然后利用现有控制器在这些路径点之间进行插值。我们的核心创新在于将该基于路径点的设定重新表述为一系列多臂老虎机问题:每个老虎机问题对应机器人运动中的一个路径点。我们从理论上证明,该重新表述的理想解相比标准框架具有更低的遗憾界。我们还提出了一种近似后验采样方法,逐个路径点地构建机器人运动。在基准仿真和两项真实世界实验中的结果表明,所提方法比当前最先进的基线方法更快地学习新任务。视频见:https://youtu.be/MMEd-lYfq4Y

关键词

引用

@article{arxiv.2403.13281,
  title  = {Waypoint-Based Reinforcement Learning for Robot Manipulation Tasks},
  author = {Shaunak A. Mehta and Soheil Habibian and Dylan P. Losey},
  journal= {arXiv preprint arXiv:2403.13281},
  year   = {2024}
}