中文

基于自动化绳网系统的广义碎片捕获鲁棒策略学习

机器人学 2022-01-13 v1 人工智能 机器学习 最优化与控制

摘要

由追踪航天器发射的绳网提供了一种有前景的方法,用于在轨捕获并清除大型空间碎片。该绳网系统在感知与执行方面受若干不确定性源影响,进而影响其网发射与闭合控制性能。然而,早期的基于可靠性的优化方法在设计控制动作时,难以推广至变化的发射场景及相对于追踪器的目标(碎片)状态,且计算代价高昂。为寻找通用且可靠的控制策略,本文提出一种强化学习框架,将近端策略优化(PPO2)方法与网动力学仿真相集成。后者可评估基于网的目捕获回合,并估计用作PPO2奖励反馈的捕获质量指标。此处,所学策略旨在基于运动网与目标的状态,在任何给定发射场景下对网闭合动作的时机进行建模。我们考虑随机状态转移模型,以纳入状态估计与发射执行中的合成不确定性。除训练期间显著的奖励提升外,训练所得策略在广泛发射/目标场景下的捕获性能接近基于可靠性的优化在单个场景上运行所得性能。

关键词

引用

@article{arxiv.2201.04180,
  title  = {Learning Robust Policies for Generalized Debris Capture with an Automated Tether-Net System},
  author = {Chen Zeng and Grant Hecht and Prajit KrisshnaKumar and Raj K. Shah and Souma Chowdhury and Eleonora M. Botta},
  journal= {arXiv preprint arXiv:2201.04180},
  year   = {2022}
}

备注

This paper has been presented at the 2022 AIAA SciTech Forum and Exposition, and accepted for publication in the corresponding AIAA proceedings