中文

通过类李雅普诺夫代理模型从观测中学习稳定控制

机器人学 2023-03-07 v1

摘要

将强化学习部署到机器人应用面临奖励工程设计的困难。因此,已有方法聚焦于通过从观测中学习(LfO)来创建奖励函数,该任务是从仅包含状态序列的专家轨迹中学习策略。我们针对重要的连续控制问题类别——学习稳定控制,提出了新的 LfO 方法,通过引入基于李雅普诺夫稳定性理论、位于专家策略与智能体策略之间充当奖励函数的中间代理模型。我们的 LfO 训练过程包含两步。第一步尝试从专家状态序列中学习类李雅普诺夫势景观代理模型,无需任何运动学模型;第二步使用该学到的势景观模型来指导训练学习者的策略。我们为这两步制定了对整体训练成功至关重要的新颖学习目标。我们在真实汽车机器人环境以及无模型设定下的其他模拟稳定控制问题(如四旋翼控制与在 MuJoCo 中保持 Hopper 直立)中评估了我们的方法。我们与最先进的方法进行比较,表明所提方法能用更少的专家观测高效学习。

关键词

引用

@article{arxiv.2303.02215,
  title  = {Learning Stabilization Control from Observations by Learning Lyapunov-like Proxy Models},
  author = {Milan Ganai and Chiaki Hirayama and Ya-Chien Chang and Sicun Gao},
  journal= {arXiv preprint arXiv:2303.02215},
  year   = {2023}
}

备注

ICRA 2023