中文

利用学习系统动力学的神经最优控制

机器人学 2023-02-21 v1

摘要

我们研究为具有未知动力学的系统生成控制律的问题。我们的方法是以神经网络表示控制器与值函数,并使用改编自哈密顿-雅可比-贝尔曼(HJB)方程的损失函数训练它们。在缺乏已知动力学模型的情况下,我们的方法首先通过离线过程中与系统交互收集的数据学习状态转移。随后将学习到的转移函数集成至 HJB 方程,并用于在反馈回路中前向模拟由我们的控制器产生的控制信号。与针对单一初始状态优化控制器的轨迹优化方法不同,我们的控制器能为来自状态空间大范围的初始状态生成近最优控制信号。相较近期基于模型的强化学习算法,我们展示该方法采样效率更高且训练速度快一个数量级。我们在若干任务中演示了我们的方法,包括具有 12 个状态变量的四旋翼控制。

关键词

引用

@article{arxiv.2302.09846,
  title  = {Neural Optimal Control using Learned System Dynamics},
  author = {Selim Engin and Volkan Isler},
  journal= {arXiv preprint arXiv:2302.09846},
  year   = {2023}
}