面向对象的概率运动基元的残差机器人学习
机器人学
2022-03-09 v1
摘要
未来的机器人能够快速学习新任务并将所学技能适应不断变化的环境是值得期待的。为此,概率运动基元(Probabilistic Movement Primitives,ProMPs)已被证明是一个有前景的框架,可从示范轨迹的分布中学习可泛化的轨迹生成器。然而,在需要高精度物体操作的实际应用中,ProMPs 的精度通常不足,特别是当它们在笛卡尔空间中从外部观测学习并以有限的控制器增益执行时。因此,我们提议将 ProMPs 与最近引入的残差强化学习(Residual Reinforcement Learning,RRL)相结合,以兼顾任务执行过程中位置和姿态的修正。具体而言,我们使用 Soft-Actor Critic 在标称 ProMP 轨迹之上学习一个残差,并将示范中的变异性作为决策变量以减少 RRL 的搜索空间。作为概念验证,我们在一个 7 自由度 Franka Emika Panda 机器人上的 3D 积木插入任务中评估了所提出的方法。实验结果表明,机器人成功学会了完成该插入任务,而这是使用基本 ProMPs 之前无法做到的。
引用
@article{arxiv.2203.03918,
title = {Residual Robot Learning for Object-Centric Probabilistic Movement Primitives},
author = {Joao Carvalho and Dorothea Koert and Marek Daniv and Jan Peters},
journal= {arXiv preprint arXiv:2203.03918},
year = {2022}
}