中文

用于追逐逃逸游戏中敏捷四旋翼机的学习控制器

机器人学 2025-09-16 v2 机器学习

摘要

我们解决了敏捷1v1四旋翼机追逐逃逸问题,其中追逐者和逃逸者通过强化学习(RL)相互机动。此类设置面临两个主要挑战: 由于每代理力的演化策略改变环境动力学并 destabilize 训练,因此存在非平稳性; 以及灾难性遗忘问题,即策略对当前对手过拟合而对先前遇到的策略失去有效性。为解决这些问题,我们提出了一种异步多阶段基于人口的算法(AMSPB)。在每个阶段,追逐者和逃逸者针对来自过去和当前策略人口中抽样的冻结对手池进行异步训练,以稳定训练并确保接触到多样化行为。在此框架内,我们训练神经网络控制器,输出速度命令或身体 rates 及总推力。高保真仿真实验表明: (i) AMSPB训练的RL策略优于RL和几何基线; (ii) 基于身体 rates 和推力的控制器实现更敏捷的飞行,从而在追逐逃逸中表现更好; (iii) AMSPB在各阶段均实现稳定、单调的提升; (iv) 一个竞技场大小中的训练策略对其他大小的竞技场几乎无需重新训练即可良好泛化。

关键词

引用

@article{arxiv.2506.02849,
  title  = {Learned Controllers for Agile Quadrotors in Pursuit-Evasion Games},
  author = {Alejandro Sanchez Roncero and Yixi Cai and Olov Andersson and Petter Ogren},
  journal= {arXiv preprint arXiv:2506.02849},
  year   = {2025}
}

备注

Under review