中文

带碰撞约束的机器人学习

机器人学 2021-02-26 v3 机器学习

摘要

在过去十年中,众多机器学习算法已被证明能成功学习最优策略以控制真实机器人系统。然而,随着学习循环推进,遭遇失败行为十分常见。具体而言,在失败不受欢迎但非灾难性的机器人应用中,许多算法难以利用从失败中获得的数据。这通常由(i)失败实验过早结束,或(ii)所获取的数据稀少或 corrupted 所致。两者均使设计适当奖励函数以惩罚失败变得复杂。本文提出一个解决这些问题的框架。我们将失败行为视为违反约束的行为,并解决带碰撞约束的学习问题,其中约束违反时无法获得数据。无数据情形由一种新颖的GP约束模型(GPCR)处理,该模型结合离散事件(失败/成功)与连续观测(仅在成功时获得)。我们在模拟基准与真实跳跃四足机器人上展示了框架的有效性,其中约束阈值是先验未知的。实验数据通过约束贝叶斯优化直接在真实机器人上收集。我们的结果优于手动调参,且GPCR在估计约束阈值上被证明有用。

关键词

引用

@article{arxiv.2010.08669,
  title  = {Robot Learning with Crash Constraints},
  author = {Alonso Marco and Dominik Baumann and Majid Khadiv and Philipp Hennig and Ludovic Righetti and Sebastian Trimpe},
  journal= {arXiv preprint arXiv:2010.08669},
  year   = {2021}
}

备注

8 pages, 4 figures, 1 table, 1 algorithm. Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Video demonstration of the experiments available at https://youtu.be/RAiIo0l6_rE . Algorithm implementation available at https://github.com/alonrot/classified_regression.git