几何纤维:用于策略学习的安全引导介质
机器人学
2024-05-06 v1
摘要
机器人策略始终要面对复杂的二阶动力学,这些动力学将其动作与结果状态紧密 entangled。在强化学习 (RL) 语境中,策略要在大量经验和复杂奖励函数的共同作用下,解码这些复杂的相互作用以了解如何完成任务。此外,策略通常直接向诸如 operational space control (OSC) 或关节 PD 控制器发出动作,这会导致这些动作目标在任务或关节空间中的直线运动。然而,这些空间中的直线运动大多不捕捉我们机器人需要表现的丰富非线性行为,将发现这些行为的负担更多地置于智能体。与这些更简单的控制器不同,几何纤维通过基于非线性几何的二阶人造动力学捕获更丰富且令人满意的行为集合。这些人造动力学通过适当的控制律将机器人的不可控动力学转化为行为动力学。行为动力学 unlock 一种新的动作空间和在此上进行 RL 策略训练的安全、引导性行为。行为动力学使 RL 策略能够发出类 bang-bang 的动作,仍然安全可用于实际机器人,简化奖励工程,并帮助在实际世界中实现高性能策略。我们更一般地描述该框架,并为 dexterous、in-hand cube 重新定位问题创建一个具体实例。
引用
@article{arxiv.2405.02250,
title = {Geometric Fabrics: a Safe Guiding Medium for Policy Learning},
author = {Karl Van Wyk and Ankur Handa and Viktor Makoviychuk and Yijie Guo and Arthur Allshire and Nathan D. Ratliff},
journal= {arXiv preprint arXiv:2405.02250},
year = {2024}
}