中文

具有鲁棒稳定性保证的 $H_\infty$ 无模型强化学习

机器学习 2020-07-28 v3 机器人学 系统与控制 系统与控制

摘要

强化学习在机器人应用中展现出巨大潜力,包括自动驾驶、机器人操控与运动。然而,由于真实世界环境中存在复杂不确定性,难以从理论上保证所学策略的成功泛化与仿真到实物的迁移。本文引入并推广鲁棒稳定性与 HH_\infty 控制的思想,以设计兼具稳定性与鲁棒性保证的策略。具体而言,提出了一种基于样本的方法,用于分析基于学习的控制系统的李雅普诺夫稳定性与性能鲁棒性。基于理论结果,开发了一种最大熵算法,用于搜索李雅普诺夫函数并设计具有可证明鲁棒稳定性保证的策略。无需任何特定领域知识,我们的方法即可找到对多种不确定性鲁棒且能良好泛化至不同测试环境的策略。在实验中,我们表明相较于鲁棒与通用强化学习以及经典控制中的最优结果,我们的方法对环境中大的脉冲扰动与参数变化均实现了更好的鲁棒性。匿名代码可用于复现实验结果:https://github.com/RobustStabilityGuaranteeRL/RobustStabilityGuaranteeRL。

关键词

引用

@article{arxiv.1911.02875,
  title  = {$H_\infty$ Model-free Reinforcement Learning with Robust Stability Guarantee},
  author = {Minghao Han and Yuan Tian and Lixian Zhang and Jun Wang and Wei Pan},
  journal= {arXiv preprint arXiv:1911.02875},
  year   = {2020}
}

备注

NeurIPS 2019 Workshop on Robot Learning: Control and Interaction in the Real World, Vancouver, Canada