中文

Smart Commander:面向飞机维修健康管理决策优化的层次化强化学习框架

机器学习 2026-04-09 v1

摘要

军事航空prognostics与健康管理(PHM)中的决策面临由于大规模作战作业中“维度灾难”,结合稀疏反馈和随机任务档案的重大挑战。为此,本文提出Smart Commander,一种 novel 的层次化强化学习(HRL)框架,用于优化顺序维护和物流决策。该框架将复杂控制问题分解为两个层次:战略级通用指挥官(General Commander)管理飞机编队的可用性和成本目标,而战术级作战指挥官(Operation Commander)执行具体的任务生成、维护调度和资源分配。该方法在自构建的高保真离散事件仿真环境中验证,该环境捕捉了飞机配置和后勤物流的动态。通过集成分层奖励引导与规划增强型神经网络,该方法有效解决稀疏和延迟奖励的难题。实证评估表明,Smart Commander显著优于传统的单体化深度强化学习(DRL)和基于规则的基线。尤其值得注意的是,它在训练时间上实现了显著减少,同时在大规模环境中的可扩展性和鲁棒性显著提升。这些结果凸显了HRL作为下一代智能编队管理可靠范式的潜力。

关键词

引用

@article{arxiv.2604.07171,
  title  = {Smart Commander: A Hierarchical Reinforcement Learning Framework for Fleet-Level PHM Decision Optimization},
  author = {Yong Si and Mingfei Lu and Jing Li and Yang Hu and Guijiang Li and Yueheng Song and Zhaokui Wang},
  journal= {arXiv preprint arXiv:2604.07171},
  year   = {2026}
}

备注

21 pages, 6 figures, 4 tables