基于随机退火跳跃启动强化学习的火箭着陆控制
机器学习
2024-07-23 v1
摘要
火箭回收是航空航天技术中的一项关键追求,旨在降低太空探索的成本和环境影响。主要焦点在于火箭着陆控制,涉及实时引导一个燃料有限的非线性欠驱动火箭。这项具有挑战性的任务促使了强化学习的应用,然而,由于缺乏中间奖励信号,该问题的目标导向性质给标准强化学习算法带来了困难。本文首次将火箭着陆控制的成功率从基线控制器的8%显著提升至使用强化学习的高保真火箭模型上的97%。我们的方法称为随机退火跳跃启动,通过利用先验反馈控制器作为引导策略来促进环境探索和策略学习,专为现实世界的目标导向问题量身定制。在每个回合中,引导策略在引导时域内导航环境,随后由探索策略接管以完成剩余步骤。这种跳跃启动策略修剪了探索空间,使问题对强化学习算法更易处理。引导时域从均匀分布中采样,其上限根据性能指标退火至零,从而缓解了现有方法中的分布偏移和不匹配问题。额外的增强功能,包括级联跳跃启动、改进的奖励和终止条件以及动作平滑性调节,进一步提升了策略性能和实际适用性。通过广泛的评估和硬件在环测试验证了所提出方法的有效性、实时可行性和控制器的平滑性。
引用
@article{arxiv.2407.15083,
title = {Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning},
author = {Yuxuan Jiang and Yujie Yang and Zhiqian Lan and Guojian Zhan and Shengbo Eben Li and Qi Sun and Jian Ma and Tianwen Yu and Changwu Zhang},
journal= {arXiv preprint arXiv:2407.15083},
year = {2024}
}
备注
IROS 2024 Oral