基于新型交互式专家的示范强化学习及其在无人艇自动靠泊控制系统中的应用
系统与控制
2022-02-25 v1 机器学习
系统与控制
摘要
本文提出两种新颖实用的示范强化学习(RLfD)方法,并将其应用于无人水面艇的自动靠泊控制系统。提出了一种称为基于模型预测专家(MPBE)的新专家数据生成方法,该方法结合模型预测控制与深度确定性策略梯度,为RLfD算法提供高质量监督数据。首先引入一种直接的RLfD方法,即模型预测深度确定性策略梯度(MP-DDPG),通过用MPBE替代RL智能体直接与环境交互。随后分析了MP-DDPG的分布失配问题,并提出了两种缓解分布失配的技术。此外,提出了另一种基于MP-DDPG的新型RLfD算法,称为自引导 actor-critic (SGAC),它可通过持续查询MPBE在线生成高质量专家数据以有效利用之。SGAC以DAgger方式解决了导致学习过程不稳定的分布失配问题。另外,给出了理论分析以证明SGAC算法能够收敛并保证单调改进。仿真结果验证了MP-DDPG与SGAC完成船舶靠泊控制任务的有效性,并显示了SGAC相对于其他典型强化学习算法及MP-DDPG的优势。
引用
@article{arxiv.2202.11325,
title = {Reinforcement Learning from Demonstrations by Novel Interactive Expert and Application to Automatic Berthing Control Systems for Unmanned Surface Vessel},
author = {Haoran Zhang and Chenkun Yin and Yanxin Zhang and Shangtai Jin and Zhenxuan Li},
journal= {arXiv preprint arXiv:2202.11325},
year = {2022}
}