中文

面向灵巧操作的约束强化学习

机器人学 2023-01-25 v1 人工智能 机器学习

摘要

现有的灵巧操作学习方法利用演示或与环境的互动来训练黑盒神经网络,这些方法对机器人如何学习技能或训练后如何表现几乎无法控制。当在物理平台上实施时,这些方法带来了重大挑战,因为在训练的初始阶段,机器人的行为可能不稳定,并可能对其自身硬件、环境或附近的人造成伤害。解决这些局限性的一种潜在方法是在学习过程中添加约束,以限制和引导机器人在训练及滚动(roll out)期间的行为。受约束方法在其他领域成功的启发,我们研究了在采用约束策略优化(Constrained Policy Optimization)学习执行物体重定位的24自由度机器人手上添加基于位置的约束的效果。我们发现,一个简单的几何约束可以确保机器人比无约束时更早学会朝物体移动。此外,使用该约束进行训练所需的样本数量与其无约束对应方法掌握该技能所需的样本数量相近。这些发现揭示了简单约束如何帮助机器人快速实现合理且安全的行为,并缓解了对硬件部署的担忧。我们还研究了这些约束的严格程度的影响,并报告了为不同严格程度如何影响学习结果提供见解的发现。我们的代码可在 https://github.com/GT-STAR-Lab/constrained-rl-dexterous-manipulation 获取。

关键词

引用

@article{arxiv.2301.09766,
  title  = {Constrained Reinforcement Learning for Dexterous Manipulation},
  author = {Abhineet Jain and Jack Kolb and Harish Ravichandar},
  journal= {arXiv preprint arXiv:2301.09766},
  year   = {2023}
}

备注

Accepted in the International Workshop on Safe Reinforcement Learning at the 31st International Joint Conference on Artificial Intelligence (IJCAI 2022). 6 pages, 5 figures