面向追逐-锁定-投射任务的仿照强化学习框架
机器学习
2025-10-13 v3 机器人学
摘要
无人战斗空中飞行器(UCAV)在视距内(WVR)交战,指的是在近距离情况下发生的两架或多架UCAV之间的战斗,在空中战场中发挥决定性作用。随着人工智能的发展,WVR交战正逐渐向智能和自主模式发展。然而, autonomous WVR交战策略的学习受到探索能力弱、学习效率低以及模拟环境不真实等挑战的制约。为克服这些挑战,我们提出了一种新型的仿照强化学习框架,有效利用专家数据,同时实现自主探索。该框架不仅通过仿照专家来提高学习效率,还通过强化学习实现对动态环境的适应性。因此,该框架能够学习UCAV的“追逐-锁定-投射”策略。为支持数据驱动的学习,我们基于Harfang3D沙箱建立了该环境。大量实验结果表明,所提框架在该多阶段任务中表现突出,显著优于最先进的强化学习和仿照学习方法。得益于仿照专家和自主探索的能力,我们的框架能够快速学习复杂空中作战任务中的关键知识,实现最高100%的成功率,展现出优异的鲁棒性。
引用
@article{arxiv.2406.11562,
title = {An Imitative Reinforcement Learning Framework for Pursuit-Lock-Launch Missions},
author = {Siyuan Li and Rongchang Zuo and Bofei Liu and Yaoyu He and Peng Liu and Yingnan Zhao},
journal= {arXiv preprint arXiv:2406.11562},
year = {2025}
}