中文

基于多智能体强化学习的高空气球分布式区域覆盖

机器学习 2025-10-07 v1 多智能体系统 机器人学

摘要

高空气球(HABs)可利用平流层风层实现有限的水平控制,为侦察、环境监测和通信网络等应用提供可能。现有的多智能体HAB协调方法使用确定性方法如 Voronoi 分区和极值寻优控制,用于大型全球星座,针对小规模团队和局部任务表现较差。虽然已证明HAB的单智能体强化学习控制可行,但多智能体强化学习(MARL)的协同控制尚未被探索。本工作首次系统性地将多智能体强化学习(MARL)应用于HAB协调的分布式区域覆盖。我们将之前开发的强化学习模拟环境(RLHAB)扩展以支持合作式多智能体学习,使多个智能体能在真实大气条件下同时运行。我们采用 QMIX 用于HAB区域覆盖协调,利用集中训练、分散执行来解决大气车辆协调的挑战。我们的方案采用专门的观察空间,提供 individual state、环境上下文和队友数据,并采用分层奖励机制优先保证覆盖率同时鼓励空间分布。我们展示,QMIX 在分布式区域覆盖方面达到的性能与理论上最优的几何确定性方法相当,验证了MARL方法的可行性,为更复杂的自主多HAB任务提供了基础,而这些任务中确定性方法变得难以处理。

关键词

引用

@article{arxiv.2510.03823,
  title  = {Distributed Area Coverage with High Altitude Balloons Using Multi-Agent Reinforcement Learning},
  author = {Adam Haroon and Tristan Schuler},
  journal= {arXiv preprint arXiv:2510.03823},
  year   = {2025}
}