中文

具有稳定性保证的Actor-Critic强化学习控制

机器人学 2020-07-16 v3 机器学习 系统与控制 系统与控制

摘要

强化学习(RL)及其与深度学习的结合已在多种机器人控制任务中取得令人印象深刻的性能,从运动规划、导航到端到端视觉操控。然而,仅使用数据的无模型RL无法保证稳定性。从控制理论视角看,稳定性是任何控制系统最重要的性质,因其与机器人系统的安全性、鲁棒性和可靠性密切相关。本文提出一种可用于控制的actor-critic RL框架,通过采用控制理论中经典的李雅普诺夫(Lyapunov)方法保证闭环稳定性。首先,针对由马尔可夫决策过程建模的随机非线性系统,提出一个基于数据的稳定性定理。接着我们表明该稳定性条件可作为actor-critic RL中的评论家(critic)来学习控制器/策略。最后,在数个知名的三维机器人控制任务及一个合成生物学基因网络跟踪任务上,于三种流行物理仿真平台中评估了方法的有效性。作为对稳定性优势的经验评估,我们展示所学策略能使系统在受到系统参数变化与外部干扰等不确定性干扰至一定程度时,恢复至平衡点或路径点。

关键词

引用

@article{arxiv.2004.14288,
  title  = {Actor-Critic Reinforcement Learning for Control with Stability Guarantee},
  author = {Minghao Han and Lixian Zhang and Jun Wang and Wei Pan},
  journal= {arXiv preprint arXiv:2004.14288},
  year   = {2020}
}

备注

IEEE RA-L + IROS 2020