面向自主船舶的时空循环强化学习
机器学习
2023-05-16 v2 机器人学
摘要
本文提出一种用于深度网络的时空循环神经网络架构,可用于操控自主船舶。该网络设计能够处理任意数量的周围目标船舶,同时对部分可观测性具有鲁棒性。此外,提出了一种最先进的碰撞风险度量,使智能体能够更轻松地评估不同态势。 maritime交通的COLREG规则在奖励函数设计中得到明确考虑。最终策略在一组新创建的称为“Around the Clock”问题的单船相遇场景以及常用的Imazu (1987)问题(包含18个多船场景)上进行验证。与人工势场和速度障碍方法的性能比较展示了所提方法在 maritime路径规划中的潜力。此外,新架构在多智能体场景中部署时表现出鲁棒性,并且兼容其他深度强化学习算法,包括actor-critic框架。
引用
@article{arxiv.2211.01004,
title = {Spatial-temporal recurrent reinforcement learning for autonomous ships},
author = {Martin Waltz and Ostap Okhrin},
journal= {arXiv preprint arXiv:2211.01004},
year = {2023}
}