中文

用于自主水下导航的数字孪生监督强化学习框架

机器学习 2025-12-12 v1 机器人学

摘要

由于缺乏 GPS、能见度下降以及存在水下障碍物,水下环境中的自主导航仍然是一项重大挑战。本文通过广泛应用于科学实验的开放平台 BlueROV2 的案例研究了这些问题。我们提出了一种基于近端策略优化(PPO)算法的深度强化学习方法,其使用的观测空间结合了面向目标的导航信息、虚拟占据栅格以及沿作业区域边界的射线投射。将学习到的策略与参考确定性运动学规划器——动态窗口法(DWA)进行了比较,后者通常被用作避障的稳健基线。评估在逼真的仿真环境中进行,并由测试场地的 3D 数字孪生监督的物理 BlueROV2 验证作为补充,这有助于降低与真实世界实验相关的风险。结果表明,在高度杂乱的环境中,PPO 策略始终优于 DWA,这主要得益于更好的局部适应性和碰撞率的降低。最后,实验证明了学习到的行为从仿真到真实世界的可迁移性,证实了深度强化学习在水下机器人自主导航中的有效性。

关键词

引用

@article{arxiv.2512.10925,
  title  = {Digital Twin Supervised Reinforcement Learning Framework for Autonomous Underwater Navigation},
  author = {Zamirddine Mari and Mohamad Motasem Nawaf and Pierre Drap},
  journal= {arXiv preprint arXiv:2512.10925},
  year   = {2025}
}