基于强化学习自博弈与状态堆叠技术的含噪空战环境方法
机器学习
2023-03-07 v1
摘要
强化学习(RL)近年已被证明是解决复杂问题的有力工具,甚至在若干挑战性应用中超越人类表现。这意味着 RL 算法可用于研究多年的自主空战问题。空战的复杂性源于激进的近距离机动与敏捷的敌方行为。除这些复杂性外,真实场景中可能因传感器误差存在不确定性,从而阻碍对敌方实际位置的估计。在此情况下,自主飞机即便在含噪环境中也应取得成功。在本研究中,我们开发了提供含噪观测给智能体的空战仿真,由此使空战问题更具挑战性。为此,我们提出一种面向含噪 RL 环境的状态堆叠方法作为降噪技术。在我们大量的实验集中,所提方法在胜率方面显著优于基线算法,且性能提升在高噪声水平下更为明显。此外,我们将自博弈方案纳入训练过程,通过周期性地使用训练智能体的冻结副本更新敌方。借此,训练智能体对具有更智能策略的敌方进行空战仿真,从而提升智能体的性能与鲁棒性。在我们的仿真中,我们证明自博弈方案相较经典 RL 训练提供了重要的性能增益。
引用
@article{arxiv.2303.03068,
title = {Reinforcement Learning Based Self-play and State Stacking Techniques for Noisy Air Combat Environment},
author = {Ahmet Semih Tasbas and Safa Onur Sahin and Nazim Kemal Ure},
journal= {arXiv preprint arXiv:2303.03068},
year = {2023}
}
备注
10 pages, 4 figures