MP3:基于运动基元的(重)规划策略
机器学习
2023-07-04 v2 人工智能
机器人学
摘要
我们提出一种称为基于运动基元的规划策略(MP3)的新型深度强化学习(RL)方法。通过将运动基元(MP)集成到深度 RL 框架中,MP3 能够在整个学习过程中生成平滑轨迹,同时有效从稀疏且非马尔可夫的奖励中学习。此外,MP3 保持在执行期间适应环境变化的能力。尽管早期机器人 RL 的许多成功通过结合 RL 与 MP 取得,这些方法通常局限于学习基于单笔画的运动,缺乏适应任务变化或执行中调整运动的能力。基于我们先前的工作(引入了针对 MP 参数对不同任务变化进行非线性适应的基于回合的 RL 方法),本文将该途径扩展至纳入重规划策略。这允许在运动执行过程中适应 MP 参数,解决需要反馈的随机域中缺乏在线运动适应的问题。我们将我们的方法与最先进的深度 RL 及带 MP 的 RL 方法进行比较。结果表明在复杂的稀疏奖励设定以及需要重规划的域中性能更优。
引用
@article{arxiv.2306.12729,
title = {MP3: Movement Primitive-Based (Re-)Planning Policy},
author = {Fabian Otto and Hongyi Zhou and Onur Celik and Ge Li and Rudolf Lioutikov and Gerhard Neumann},
journal= {arXiv preprint arXiv:2306.12729},
year = {2023}
}
备注
The video demonstration can be accessed at https://intuitive-robots.github.io/mp3_website/. arXiv admin note: text overlap with arXiv:2210.09622