用于航天器制导与控制网络的行为克隆与强化学习比较
系统与控制
2025-07-29 v1 地球与行星天体物理
天体物理仪器与方法
机器学习
系统与控制
摘要
制导与控制网络(G&CNETs)为航天器提供了一种有前景的星载制导与控制(G&C)架构替代方案,提供了制导与控制架构的可微、端到端表示。在训练 G&CNETs 时,出现了两种主要范式:模仿最优轨迹的行为克隆(BC),以及通过试错学习最优行为的强化学习(RL)。尽管这两种方法都已被采用在 G&CNET 相关文献中,但直接比较仍然明显缺失。为了解决这个问题,我们专门针对连续推力航天器轨迹优化任务上的 G&CNET 训练,对 BC 和 RL 进行了系统评估。我们引入了一种为 G&CNETs 量身定制的新颖 RL 训练框架,结合了解耦的动作与控制频率以及奖励重分配策略,以稳定训练并提供公平的比较。我们的结果表明,经 BC 训练的 G&CNETs 擅长紧密复制专家策略行为,从而复制确定性环境的最优控制结构,但可能会受到训练数据集质量和覆盖范围的负面约束。相比之下,经 RL 训练的 G&CNETs 除了展现出对随机条件更强的适应性外,还能发现改进次优专家演示的解决方案,有时能揭示生成训练样本时遗漏的全局最优策略。
引用
@article{arxiv.2507.19535,
title = {Comparing Behavioural Cloning and Reinforcement Learning for Spacecraft Guidance and Control Networks},
author = {Harry Holt and Sebastien Origer and Dario Izzo},
journal= {arXiv preprint arXiv:2507.19535},
year = {2025}
}