使用增强型深度强化学习设计逃逸飞行器的导引方案
软件工程
2024-05-08 v1 人工智能
机器学习
摘要
飞行器的导引命令以固定时间间隔为一系列数据集,因此导引设计构成一个序列决策问题,满足深度强化学习(DRL)的基本条件。本文考虑以下场景:逃逸飞行器(EFV)基于 DRL 生成导引命令,而追逐飞行器(PFV)基于比例导航方法生成导引命令。对于 EFV,导引设计的目标是逐步最大化剩余速度,同时受给定逃逸距离的约束。因此,形式化了一个极大规模的非定常动态 max-min 问题,其中最优解可达的时间点不确定,最优解取决于之前生成的所有中间导引命令。为解决此问题,构思了两步策略。第一步使用近端策略优化(PPO)算法生成 EFV 的导引命令。尽管奖励函数、神经网络参数和学习率设计得很精细,但 PPO 在全局搜索空间的结果较粗糙。因此,在第二步,我们提出使用基于演化策略(ES)的算法,以 PPO 的结果作为初始值,在局部空间中进一步提高解的质量。仿真结果表明,基于 PPO 算法的导引设计方法能够实现剩余速度为 67.24 m/s,高于基准软演员-临界策略和深度确定性策略梯度算法的剩余速度。此外,提出的 ES 增强型 PPO 算法比 PPO 算法高出 2.7%,实现剩余速度为 69.04 m/s。
引用
@article{arxiv.2405.03710,
title = {Automating the Enterprise with Foundation Models},
author = {Michael Wornow and Avanika Narayan and Krista Opsahl-Ong and Quinn McIntyre and Nigam H. Shah and Christopher Re},
journal= {arXiv preprint arXiv:2405.03710},
year = {2024}
}