中文

通过上图形式与深度强化学习求解稳定-避障最优控制

机器人学 2023-05-24 v1 最优化与控制

摘要

自主机器人系统的任务通常要求在维持安全规范的同时稳定至期望区域。然而,当动力学为非线性且高维时,求解这一多目标问题具有挑战性,因为传统方法难以扩展且常局限于特定问题结构。为解决此问题,我们提出一种新方法,通过求解无限时域约束最优控制问题(OCP)来处理稳定-避障问题。我们将约束 OCP 转化为上图形式,得到一个两阶段优化问题:在内层问题中优化策略,在外层问题中优化辅助变量。随后,我们针对该公式提出一种结合 on-policy 深度强化学习算法与神经网络回归的新方法。相比更传统的方法,我们的方法在训练期间具有更好的稳定性,避免了由鞍点寻找引起的不稳定性,且不受问题结构特定要求的限制。我们在不同基准任务上验证了我们的方法,从低维玩具示例到具有 17 维状态空间的 F16 战斗机。仿真结果表明,我们的方法一致地产生匹配或超越现有方法安全性的控制器,同时从更大吸引域带来十倍稳定性性能提升。

关键词

引用

@article{arxiv.2305.14154,
  title  = {Solving Stabilize-Avoid Optimal Control via Epigraph Form and Deep Reinforcement Learning},
  author = {Oswin So and Chuchu Fan},
  journal= {arXiv preprint arXiv:2305.14154},
  year   = {2023}
}

备注

Accepted to Robotics: Science and Systems 2023. Project page can be found at https://mit-realm.github.io/efppo