基于同伦与最大熵的自主空战强化学习
机器学习
2021-12-03 v1 人工智能
摘要
无人作战飞机 (UCAV) 的智能决策长期以来一直是一个具有挑战性的问题。传统的搜索方法难以满足高动态空战场景下的实时需求。强化学习 (RL) 方法可通过使用神经网络显著缩短决策时间。然而,稀疏奖励问题限制了其收敛速度,而人工先验经验奖励容易使其偏离原始任务的最优收敛方向,这给 RL 空战应用带来了很大困难。本文提出一种基于同伦的软 actor-critic 方法 (HSAC),该方法通过遵循具有稀疏奖励的原始任务与具有人工先验经验奖励的辅助任务之间的同伦路径来解决这些问题。本文还证明了该方法的收敛性与可行性。为验证我们所提方法的可行性,我们首先构建了一个详细的 3D 空战仿真环境用于基于 RL 的方法训练,并将我们的方法应用于攻击水平飞行 UCAV 任务与自博弈对抗任务。实验结果表明,我们的方法优于仅利用稀疏奖励或人工先验经验奖励的方法。由我们的方法训练的智能体在攻击水平飞行 UCAV 任务中可达到超过 98.3% 的胜率,在与由另外两种方法训练的智能体对抗时平均胜率为 67.4%。
引用
@article{arxiv.2112.01328,
title = {Homotopy Based Reinforcement Learning with Maximum Entropy for Autonomous Air Combat},
author = {Yiwen Zhu and Zhou Fang and Yuan Zheng and Wenya Wei},
journal= {arXiv preprint arXiv:2112.01328},
year = {2021}
}