中文

面向自主船舶的时空循环强化学习

机器学习 2023-05-16 v2 机器人学

摘要

本文提出一种用于深度QQ网络的时空循环神经网络架构,可用于操控自主船舶。该网络设计能够处理任意数量的周围目标船舶,同时对部分可观测性具有鲁棒性。此外,提出了一种最先进的碰撞风险度量,使智能体能够更轻松地评估不同态势。 maritime交通的COLREG规则在奖励函数设计中得到明确考虑。最终策略在一组新创建的称为“Around the Clock”问题的单船相遇场景以及常用的Imazu (1987)问题(包含18个多船场景)上进行验证。与人工势场和速度障碍方法的性能比较展示了所提方法在 maritime路径规划中的潜力。此外,新架构在多智能体场景中部署时表现出鲁棒性,并且兼容其他深度强化学习算法,包括actor-critic框架。

关键词

引用

@article{arxiv.2211.01004,
  title  = {Spatial-temporal recurrent reinforcement learning for autonomous ships},
  author = {Martin Waltz and Ostap Okhrin},
  journal= {arXiv preprint arXiv:2211.01004},
  year   = {2023}
}