利用未来参考信息的前向策略优化跟踪控制
机器学习
2021-07-21 v1 机器人学
系统与控制
系统与控制
摘要
近年来,强化学习(RL)在工程控制中受到越来越多的关注。尤其是策略梯度方法被广泛使用。在这项工作中,我们通过引入未来参考值信息,改进了 proximal policy optimization(PPO,前向策略优化)对任意参考信号的跟踪性能。提出了两种考虑未来参考值扩展 actor 和 critic 参数的变体。在第一种变体中,将全局未来参考值加入参数中。对于第二种变体,引入了一种适用于无模型强化学习的带有未来参考值的新型残差空间。我们的方法在简单传动系统模型上对照 PI 控制器进行了评估。我们期望该方法比先前的方法能更好地泛化到任意参考信号,指向 RL 在真实系统控制中的适用性。
引用
@article{arxiv.2107.09647,
title = {Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information},
author = {Jana Mayer and Johannes Westermann and Juan Pedro Gutiérrez H. Muriedas and Uwe Mettin and Alexander Lampe},
journal= {arXiv preprint arXiv:2107.09647},
year = {2021}
}