基于强化学习的自动靠泊系统
机器学习
2021-12-06 v1 系统与控制
系统与控制
摘要
以往基于人工神经网络(ANN)的自动靠泊系统研究通过将船舶靠泊数据作为训练数据来训练 ANN,展现出优异的靠泊性能。然而,由于 ANN 需要大量训练数据才能获得稳健性能,基于 ANN 的自动靠泊系统因靠泊数据难以获取而存在一定局限。本研究为克服此困难,提出了一种基于强化学习(RL)算法之一——近端策略优化(PPO)——的自动靠泊系统,因为 RL 算法可通过与给定环境交互试错学习最优控制策略,且无需任何预先获取的训练数据;其中所提基于 PPO 的自动靠泊系统的控制策略控制船舶的每秒转速(RPS)与舵角。最后表明,所提基于 PPO 的自动靠泊系统免除了获取训练数据集的需要,并在实际靠泊应用中展现出巨大潜力。
引用
@article{arxiv.2112.01879,
title = {Reinforcement Learning-Based Automatic Berthing System},
author = {Daesoo Lee},
journal= {arXiv preprint arXiv:2112.01879},
year = {2021}
}