基于深度强化学习的航天器反应轮姿态控制智能控制
机器人学
2025-07-14 v1 人工智能
摘要
可靠的卫星姿态控制对于空间任务的成功至关重要,尤其是当卫星在动态且不可预测的环境中实现自主运营时。反应轮 (RW) 在姿态控制中发挥着关键作用,在 RW 故障时维持控制韧性对于保持任务目标和系统稳定性至关重要。然而,传统的比例仿射控制器 (PD) 以及现有的深度强化学习 (DRL) 算法如 TD3、PPO 和 A2C 常常无法满足自主卫星运营所需的实时适应性和故障容错性要求。本研究引入一种基于 DRL 的控制策略,以提高卫星在故障条件下的韧性和适应性。具体而言,本文提出的方法将 Twin Delayed Deep Deterministic Policy Gradient (TD3) 集成 Hindsight Experience Replay (HER) 和 Dimension Wise Clipping (DWC),称为 TD3-HD,以增强在稀疏奖励环境中的学习能力,并在 RW 故障期间维持卫星稳定性。该方法以 PD 控制和领先的 DRL 算法为基准进行评估。实验结果表明,TD3-HD 在姿态误差、角速度调节以及故障条件下的稳定性方面均显著优于其他方法。这一发现凸显了该方法在具备故障容错性的 onboard AI 解决方案中,作为自主卫星姿态控制的强大潜力。
引用
@article{arxiv.2507.08366,
title = {Intelligent Control of Spacecraft Reaction Wheel Attitude Using Deep Reinforcement Learning},
author = {Ghaith El-Dalahmeh and Mohammad Reza Jabbarpour and Bao Quoc Vo and Ryszard Kowalczyk},
journal= {arXiv preprint arXiv:2507.08366},
year = {2025}
}