中文

行为树中运动技能参数的学习

机器人学 2022-08-03 v2 机器学习

摘要

强化学习(RL)是一个强大的数学框架,使机器人能通过试错学习复杂技能。尽管在许多应用中取得了大量成功,RL 算法仍需要数千次试验才能收敛到高性能策略,可能在学习中产生危险行为,且优化后的策略(通常建模为神经网络)在任务执行失败时几乎无法给出任何解释。出于这些原因,RL 在工业环境中的采用并不普遍。另一方面,行为树(BTs)可提供这样一种策略表示:a) 支持模块化与可组合技能,b) 便于对机器人动作进行解释,c) 提供有利的低维参数空间。本文中,我们提出一种新颖算法,能在仿真中学习 BT 策略的参数,并在无需额外训练的情况下泛化至物理机器人。我们利用带有工作站数字孪生的物理模拟器,通过黑盒优化器优化相关参数。我们以 7-DOF KUKA-iiwa 机械臂在一个包含避障与富接触插入( peg-in-hole)的任务中展示了方法的有效性,其中我们的方法优于基线。

关键词

引用

@article{arxiv.2109.13050,
  title  = {Learning of Parameters in Behavior Trees for Movement Skills},
  author = {Matthias Mayr and Konstantinos Chatzilygeroudis and Faseeh Ahmad and Luigi Nardi and Volker Krueger},
  journal= {arXiv preprint arXiv:2109.13050},
  year   = {2022}
}

备注

8 pages, 5 figures, accepted at 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)