一种用于6自由度无人机空战格斗的分层深度强化学习框架
人工智能
2024-09-21 v1 系统与控制
系统与控制
摘要
无人作战飞机(UCAV)格斗是一个具有连续动作空间的挑战性场景。本文提出一种通用分层框架,以解决6自由度(6-DOF)动力学下的视距内(WVR)空对空作战问题。其核心思想是将整个决策过程划分为两个环路,并分别使用强化学习(RL)求解。外环考虑当前作战态势,并根据作战策略决定飞机的期望宏观行为。随后内环通过飞行控制器计算飞机的实际输入信号来跟踪该宏观行为。我们为外环策略与内环控制器设计了马尔可夫决策过程,并使用近端策略优化(PPO)算法进行训练。对于内环控制器,我们设计了一种有效的奖励函数以精确跟踪各类宏观行为。对于外环策略,我们进一步采用虚构自博弈机制,通过不断与历史策略对抗来提升作战性能。实验结果表明,内环控制器比精细调参的PID控制器具有更好的跟踪性能,且外环策略能够执行复杂机动以随着代际演化获得越来越高的胜率。
引用
@article{arxiv.2212.03830,
title = {A Hierarchical Deep Reinforcement Learning Framework for 6-DOF UCAV Air-to-Air Combat},
author = {Jiajun Chai and Wenzhang Chen and Yuanheng Zhu and Zong-xin Yao and Dongbin Zhao},
journal= {arXiv preprint arXiv:2212.03830},
year = {2024}
}