中文

用于鲁棒策略的连续时间拟合值迭代

机器人学 2021-10-06 v1 机器学习

摘要

求解 Hamilton-Jacobi-Bellman 方程在控制、机器人与经济学等许多领域都很重要。尤其对于连续控制,求解这一微分方程及其推广的 Hamilton-Jacobi-Isaacs 方程十分重要,因为它给出了在给定任务上获得最大奖励的最优策略。在 Hamilton-Jacobi-Isaacs 方程中,包含一个控制环境并最小化奖励的对抗者,所得策略同时对动力学扰动具有鲁棒性。在本文中,我们提出连续拟合值迭代(cFVI)与鲁棒拟合值迭代(rFVI)。这些算法利用许多连续控制问题的非线性控制仿射动力学以及状态与动作奖励可分离的特性,以闭式导出最优策略与最优对抗者。该解析表达式简化了微分方程,使我们能够使用针对连续动作与状态以及对抗情形的值迭代求解最优值函数。值得注意的是,所得算法不需要对状态或动作进行离散化。我们将所得算法应用于 Furuta 摆与 cartpole(倒立摆小车)。我们表明两种算法均获得最优策略。在物理系统上的鲁棒性 Sim2Real 实验显示,策略在真实世界中成功完成任务。当改变摆的质量时,我们观察到鲁棒值迭代相比深度强化学习算法及该算法的非鲁棒版本更具鲁棒性。实验视频见 https://sites.google.com/view/rfvi

关键词

引用

@article{arxiv.2110.01954,
  title  = {Continuous-Time Fitted Value Iteration for Robust Policies},
  author = {Michael Lutter and Boris Belousov and Shie Mannor and Dieter Fox and Animesh Garg and Jan Peters},
  journal= {arXiv preprint arXiv:2110.01954},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2105.12189