基于多智能体强化学习的 Douro 河湊流长期制图
多智能体系统
2026-05-28 v5 机器学习
系统与控制
系统与控制
机器学习
摘要
我们研究了使用多个自主 underwater 车(AUV)进行河湊流(river plume)长期(多天)制图的问题,聚焦于 Douro 河的代表性用例。我们提出了一种能源和通信效率高的多智能体强化学习方法,其中中心协调器可间歇地与 AUV 通信,收集测量值并发布命令。该方法将时空高斯过程回归(GPR)与多头 Q 网络控制器相结合,后者控制每个 AUV 的方向和速度。使用 Delft3D 海洋模型进行仿真,结果表明该方法在单智能体和多智能体基准测试中均表现出色,随着智能体数量的增加,均方差(MSE)和运营耐久性都得到改善。在某些情况下,该算法表明,双倍 AUV 数量最多可使耐久性翻倍,同时保持或提高精度,凸显了多智能体协作的优势。我们的所学策略在不同月份和年份的不同季节 regime 下均能泛化,为数据驱动的动态湊流环境的长期监控发展指明了前景。
引用
@article{arxiv.2510.03534,
title = {Long-Term Mapping of the Douro River Plume with Multi-Agent Reinforcement Learning},
author = {Nicolò Dal Fabbro and Milad Mesbahi and Renato Mendes and João Borges de Sousa and George J. Pappas},
journal= {arXiv preprint arXiv:2510.03534},
year = {2026}
}
备注
Accepted at the 2026 IEEE International Conference on Robotics and Automation