中文

RMP2:一种用于机器人学习的结构化可组合策略类

机器人学 2021-03-11 v1 机器学习 系统与控制 系统与控制

摘要

我们考虑为基于加速度的机器人系统学习运动策略的问题,其结构化策略类由 RMPflow 指定。RMPflow 是一个多任务控制框架,已成功应用于许多机器人问题。将 RMPflow 用作学习中的结构化策略类具有若干好处,例如充分的表达能力、注入不同层次先验知识的灵活性,以及策略在机器人之间迁移的能力。然而,实现一个用于端到端学习 RMPflow 策略的系统面临若干计算挑战。在本工作中,我们重新检视 RMPflow 的消息传递算法,并提出一种更高效的替代算法,称为 RMP2,它使用现代自动微分工具(如 TensorFlow 和 PyTorch)来计算 RMPflow 策略。我们的新设计保留了 RMPflow 的优势,同时带来了自动微分带来的好处,包括:1) 用于设计复杂变换的简易编程接口;2) 支持一般的 directed acyclic graph (DAG) 变换结构;3) 用于策略学习的端到端可微性;4) 提升的计算效率。由于这些特性,RMP2 可被视为一种用于高效机器人学习的结构化策略类,适用于编码领域知识。我们的实验表明,在杂乱空间中进行目标到达的强化学习任务里,使用 RMP2 给出的结构化策略类能够改善策略性能与安全性。

关键词

引用

@article{arxiv.2103.05922,
  title  = {RMP2: A Structured Composable Policy Class for Robot Learning},
  author = {Anqi Li and Ching-An Cheng and M. Asif Rana and Man Xie and Karl Van Wyk and Nathan Ratliff and Byron Boots},
  journal= {arXiv preprint arXiv:2103.05922},
  year   = {2021}
}