中文

基于自适应变换的 underwater 声学跟踪多智能体强化学习扩缩方法

机器人学 2025-10-20 v2 人工智能 分布式、并行与集群计算 性能

摘要

自主车辆(AV)为科学任务提供了成本有效的解决方案。近期,强化学习(RL)已成为控制海洋环境中AV的强大方法。然而,将这些技术扩展到编队——对于多目标跟踪或目标快速不可预测运动至关重要——面临着显著计算挑战。多智能体强化学习(MARL)样本效率极低,而高保真仿真器如Gazebo的LRAUV虽可实现单机器人实时速度的100倍,但对多车辆场景几乎无显著加速,使MARL训练难以实施。为克服此限制,本文提出一种迭代蒸馏方法,将高保真仿真转化为简化的GPU加速环境,同时保持高层次动态特性。该方法通过并行化实现对Gazebo的30,000倍加速,使GPU端到端加速训练成为可能。此外,本文引入一种新型Transformer架构(TransfMAPPO),学习对智能体数目和目标数目不变的多智能体策略,显著提升样本效率。基于在GPU上完成的大规模课程学习,我们在Gazebo中进行了广泛评估,结果表明该方法即使在面对多个快速移动目标的情况下,仍能维持跟踪误差低于5米的持续时长。该工作弥合了大规模MARL训练与高保真部署之间的鸿沟,为真实海洋任务中的自主编队控制提供可扩展框架。

关键词

引用

@article{arxiv.2505.08222,
  title  = {Scaling Multi Agent Reinforcement Learning for Underwater Acoustic Tracking via Autonomous Vehicles},
  author = {Matteo Gallici and Ivan Masmitja and Mario Martín},
  journal= {arXiv preprint arXiv:2505.08222},
  year   = {2025}
}