基于不对称六角网格的航海覆盖路径规划的无批评家深度强化学习
机器学习
2026-03-31 v1 人工智能
神经与进化计算
机器人学
摘要
航海监视任务(如搜救和环境监测)依赖于对广阔且几何复杂区域高效分配探测资源。传统的覆盖路径规划(CPP)方法依赖分解技术,难以处理不规则海岸线、岛屿和排除区,或需要针对每个实例进行计算昂贵的重新规划。我们提出一个深度强化学习(DRL)框架,用于解决六角网格表示的不规则航海区域的CPP。不同于常规方法,我们将问题表述为神经组合优化任务,其中基于 Transformer 的指针策略自回归地构建覆盖路径。为克服长期路径问题中价值估计的不稳定性,我们实现了一个无批评家的 Group-Relative Policy Optimization(GRPO)方案。该方法通过样本轨迹在实例内的比较来估计优势,而不依赖价值函数。在1000个未知的合成航海环境中进行的实验表明,训练后的策略实现了99.0%的哈特福德成功率,远高于最佳启发式方法(46.0%),同时产生的路径比最近的基线短7%,且航向变化减少24%。所有三个推理模式(贪婪、随机抽样和带 2-opt 优化的抽样)在笔记本 GPU 上每实例运行时间在50~ms以内,证明了可用于实时 onboard 部署的可行性。
引用
@article{arxiv.2603.28385,
title = {Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids},
author = {Carlos S. Sepúlveda and Gonzalo A. Ruz},
journal= {arXiv preprint arXiv:2603.28385},
year = {2026}
}