中文

基于深度强化学习的不完全信息下主动防御航天器协同制导策略

系统与控制 2022-12-07 v1 系统与控制

摘要

本文针对试图规避拦截器的目标航天器的主动防护问题,提出了一种自适应协同制导策略。目标航天器执行规避机动,并发射主动防御飞行器以转移拦截器。与基于最优控制或微分博弈理论的经典策略不同,该问题采用深度强化学习方法求解,并假设拦截器机动能力具有不完全信息。为解决稀疏奖励问题,利用塑造技术提出了一种通用奖励设计方法和渐进困难训练方法。通过学习过程和蒙特卡洛仿真验证了制导律、奖励函数及训练方法。非稀疏奖励函数和渐进困难训练方法的应用加速了模型收敛,缓解了过拟合问题。以标准最优制导律为基准,仿真结果验证了所提制导策略的有效性和优势,其保证了多智能体博弈中目标航天器的逃逸率和胜率。训练所得智能体对拦截器机动能力的适应性优于最优制导律。此外,与标准最优制导律相比,所提制导策略在更少先验知识下表现更优。

关键词

引用

@article{arxiv.2212.03093,
  title  = {Cooperative Guidance Strategy for Active Defense Spacecraft with Imperfect Information via Deep Reinforcement Learning},
  author = {Li Zhi and Haizhao Liang and Jinze Wu and Jianying Wang and Yu Zheng},
  journal= {arXiv preprint arXiv:2212.03093},
  year   = {2022}
}