基于深度强化学习的飞机失控恢复控制设计
系统与控制
2026-01-13 v1 系统与控制
摘要
失控(Loss-of-Control, LOC)仍是固定翼飞机事故的主要原因,尤其是在后失速和平滑旋转 regime中,传统的gain-scheduled或基于逻辑的恢复法则可能失效。本研究将旋翼恢复建模为连续状态、连续动作的马尔可夫决策过程(MDP),并在高保真六自由度F-18/HARV模型上训练一个proximal policy optimization(PPO)智能体,该模型包括非线性气动力学、执行器饱和和速率耦合。一个two-phase基于潜在的奖励结构首先惩罚大角速度,然后强制飞行稳定。经过6000次模拟episode后,该策略对未见的 upset初始条件具有良好的泛化能力。结果表明,所学的策略成功地抑制了角速度并稳定了攻角。该控制器的性能被观察为在从旋翼条件恢复方面表现满意,该性能与一种state-of-the-art的sliding mode控制器进行了比较。我们的发现表明,深度强化学习可以为实时失控缓解提供可解释、动态可行的机动,并为flight-critical RL部署提供了路径。
引用
@article{arxiv.2601.06439,
title = {Deep Reinforcement Learning based Control Design for Aircraft Recovery from Loss-of-Control Scenario},
author = {Imran Sayyed and Aayush Konar and Nandan Kumar Sinha},
journal= {arXiv preprint arXiv:2601.06439},
year = {2026}
}
备注
This paper has been accepted for publication in conference proceedings of 2025, 11th Indian Control Conference