中文

通过分层协同自博弈强化学习掌握多无人机排球

人工智能 2026-02-27 v5

摘要

在本文中,我们解决了学习进行 3v3 多无人机排球的问题,这是一项新的具身竞争任务,需要高层战略协调和低层敏捷控制。该任务是回合制、多智能体且基于物理的,由于其长时距依赖性、紧密的智能体间耦合以及四旋翼的欠驱动动力学而带来重大挑战。为了解决这个问题,我们提出了分层协同自博弈 (HCSP),这是一个分层强化学习框架,将集中式高层战略决策与去中心化低层运动控制分离开来。我们设计了一个三阶段基于种群的训练流程,使策略和技能能够在没有专家演示的情况下从零开始涌现:(I) 训练多样化的低层技能,(II) 在固定低层技能下通过自博弈学习高层策略,以及 (III) 通过协同自博弈进行联合微调。实验表明,HCSP 取得了卓越的性能,以平均 82.9% 的胜率优于非分层自博弈和基于规则的分层基线,并且对两阶段变体的胜率达到 71.5%。此外,协同自博弈导致了角色切换和协调阵型等涌现的团队行为,证明了我们分层设计和训练方案的有效性。项目页面位于 https://hi-co-self-play.github.io。

关键词

引用

@article{arxiv.2505.04317,
  title  = {Mastering Multi-Drone Volleyball through Hierarchical Co-Self-Play Reinforcement Learning},
  author = {Ruize Zhang and Sirui Xiang and Zelai Xu and Feng Gao and Shilong Ji and Wenhao Tang and Wenbo Ding and Chao Yu and Yu Wang},
  journal= {arXiv preprint arXiv:2505.04317},
  year   = {2026}
}

备注

Accepted by CoRL 2025