中文

增强型深度强化学习在逃逸飞行器导引设计中的应用

机器学习 2025-03-05 v2 人工智能

摘要

飞行器的导引命令以固定时间间隔为一系列数据集,因此导引设计构成一个序列决策问题,满足深度强化学习(DRL)的基本条件。本文考虑以下场景:逃逸飞行器(EFV)基于 DRL 生成导引命令,而追逐飞行器(PFV)基于比例导航方法生成导引命令。对于 EFV,导引设计的目标是逐步最大化剩余速度,同时受给定逃逸距离的约束。因此,形式化了一个极大规模的非定常动态 max-min 问题,其中最优解可达的时间点不确定,最优解取决于之前生成的所有中间导引命令。为解决此问题,构思了两步策略。第一步使用近端策略优化(PPO)算法生成 EFV 的导引命令。尽管奖励函数、神经网络参数和学习率设计得很精细,但 PPO 在全局搜索空间的结果较粗糙。因此,在第二步,我们提出使用基于演化策略(ES)的算法,以 PPO 的结果作为初始值,在局部空间中进一步提高解的质量。仿真结果表明,基于 PPO 算法的导引设计方法能够实现剩余速度为 67.24 m/s,高于基准软演员-临界策略和深度确定性策略梯度算法的剩余速度。此外,提出的 ES 增强型 PPO 算法比 PPO 算法高出 2.7%,实现剩余速度为 69.04 m/s。

关键词

引用

@article{arxiv.2405.03714,
  title  = {UniDEC : Unified Dual Encoder and Classifier Training for Extreme Multi-Label Classification},
  author = {Siddhant Kharbanda and Devaansh Gupta and Gururaj K and Pankaj Malhotra and Amit Singh and Cho-Jui Hsieh and Rohit Babbar},
  journal= {arXiv preprint arXiv:2405.03714},
  year   = {2025}
}