中文

基于强化学习自博弈与状态堆叠技术的含噪空战环境方法

机器学习 2023-03-07 v1

摘要

强化学习(RL)近年已被证明是解决复杂问题的有力工具,甚至在若干挑战性应用中超越人类表现。这意味着 RL 算法可用于研究多年的自主空战问题。空战的复杂性源于激进的近距离机动与敏捷的敌方行为。除这些复杂性外,真实场景中可能因传感器误差存在不确定性,从而阻碍对敌方实际位置的估计。在此情况下,自主飞机即便在含噪环境中也应取得成功。在本研究中,我们开发了提供含噪观测给智能体的空战仿真,由此使空战问题更具挑战性。为此,我们提出一种面向含噪 RL 环境的状态堆叠方法作为降噪技术。在我们大量的实验集中,所提方法在胜率方面显著优于基线算法,且性能提升在高噪声水平下更为明显。此外,我们将自博弈方案纳入训练过程,通过周期性地使用训练智能体的冻结副本更新敌方。借此,训练智能体对具有更智能策略的敌方进行空战仿真,从而提升智能体的性能与鲁棒性。在我们的仿真中,我们证明自博弈方案相较经典 RL 训练提供了重要的性能增益。

关键词

引用

@article{arxiv.2303.03068,
  title  = {Reinforcement Learning Based Self-play and State Stacking Techniques for Noisy Air Combat Environment},
  author = {Ahmet Semih Tasbas and Safa Onur Sahin and Nazim Kemal Ure},
  journal= {arXiv preprint arXiv:2303.03068},
  year   = {2023}
}

备注

10 pages, 4 figures