基于强化学习的六自由度航天器自主对接机动
系统与控制
2020-08-10 v1 系统与控制
摘要
通过强化学习开发了一种六自由度对接机动策略,并作为反馈控制律实现。强化学习为不确定环境中低星载计算成本的鲁棒自主机动提供了潜在框架。具体而言,使用近端策略优化(proximal policy optimization)生成在六自由度状态空间部分区域有效、同时力求最小化性能与控制代价的对接策略。使用模拟的阿波罗转位与对接机动的实验展示了该策略的能力,并与标准最优控制技术进行了比较。此外,讨论了具体挑战与应对方法,以及强化学习用于对接策略的优缺点,以促进未来研究。因此,本工作将作为不确定环境中航天器邻近操作基于学习的控制律进一步研究的基础。
引用
@article{arxiv.2008.03215,
title = {Autonomous Six-Degree-of-Freedom Spacecraft Docking Maneuvers via Reinforcement Learning},
author = {Charles E. Oestreich and Richard Linares and Ravi Gondhalekar},
journal= {arXiv preprint arXiv:2008.03215},
year = {2020}
}
备注
Conference: 2020 AAS/AIAA Astrodynamics Specialist Virtual Lake Tahoe Conference