基于柔性策略迭代的含人回路机器人膝关节强化学习控制
系统与控制
2021-01-19 v2 机器学习
系统与控制
摘要
我们受人机系统实际挑战的启发,致力于开发在数据层面高效、在系统层面具有稳定性与最优性等性能保证的新设计。现有考虑系统性能的近似/自适应动态规划(ADP)成果尚不能为此问题提供实际有用的学习控制算法;而解决数据效率问题的强化学习(RL)算法通常对被控系统没有性能保证。本研究通过为策略迭代算法引入创新特性来填补这些重要空白。我们提出柔性策略迭代(FPI),其可灵活且有机地将经验回放与来自先验经验的补充值整合进RL控制器。我们展示了系统级性能,包括近似值函数的收敛性、解的(次)最优性以及系统的稳定性。我们通过人机系统的真实仿真证明了FPI的有效性。需注意,本研究面临的问题难以通过基于经典控制理论的设计方法解决,因为几乎不可能在线或离线获得人机系统的定制数学模型。我们所获结果也表明RL控制在解决具有高维控制输入的现实且具挑战性问题方面的巨大潜力。
引用
@article{arxiv.2006.09008,
title = {Reinforcement Learning Control of Robotic Knee with Human in the Loop by Flexible Policy Iteration},
author = {Xiang Gao and Jennie Si and Yue Wen and Minhan Li and He and Huang},
journal= {arXiv preprint arXiv:2006.09008},
year = {2021}
}