中文

进化增强的多主体强化学习用于合作空中战斗

人工智能 2026-05-26 v1

摘要

随着现代空战向远距离(BVR)多飞机协同作战演变,自动决策对于无人作战空中飞行器(UCAV)面临显著挑战,由于高维状态空间、离散动作命令以及强对抗动态环境。为克服现有多主体强化学习(MARL)方法在此类设置下的局限性,即探索效率不足、样本利用率低、策略泛化性差,我们提出了对抗课程和进化增强的多主体策略梯度优化(ACE-MAPPO),这是一种集成进化算法与 MAPPO 的混合学习框架。具体而言,引入一种遗传软更新机制以增强种群多样性并缓解收敛到局部最优。进一步采用进化增强的优先级轨迹回放策略以提高稀疏高价值样本的利用率。此外,设计了一种对抗性进化课程学习机制,以实现难度逐渐增加的自适应训练。大量实验结果表明,所提方法在训练稳定性、收敛速度和赢得率方面均优于 MAPPO 和其他基线算法,验证了其在多飞机协同空中战斗场景中的有效性。

关键词

引用

@article{arxiv.2605.25091,
  title  = {Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat},
  author = {Chengwei Li and Junlin Liu and Yang Gao},
  journal= {arXiv preprint arXiv:2605.25091},
  year   = {2026}
}