重新审视空间任务规划:一种面向多碎片交会的强化学习引导方法
机器学习
2024-09-26 v1 人工智能
机器人学
摘要
本研究引入了深度强化学习(RL)领域中掩码近端策略优化(PPO)算法的一种新颖应用,利用 Izzo 改编的 Lambert 求解器进行单次交会,以确定最高效的空间碎片访问顺序。目的是优化所有给定碎片的访问顺序,以使整个任务的交会总时间最短。开发了一种神经网络(NN)策略,并在具有不同碎片场的模拟空间任务中进行训练。训练后,神经网络使用 Izzo 改编的 Lambert 机动计算近似最优路径。根据任务规划中的标准启发式方法评估了性能。强化学习方法通过优化碎片交会顺序,在规划效率上表现出显著提升,与遗传算法和贪心算法相比,总任务时间平均分别减少了约 {10.96\%} 和 {13.66\%}。该模型在各种模拟场景中平均能以最快的计算速度识别出最省时的碎片访问顺序。该方法标志着在提升空间碎片清除任务规划策略方面迈出了一步。
引用
@article{arxiv.2409.16882,
title = {Revisiting Space Mission Planning: A Reinforcement Learning-Guided Approach for Multi-Debris Rendezvous},
author = {Agni Bandyopadhyay and Guenther Waxenegger-Wilfing},
journal= {arXiv preprint arXiv:2409.16882},
year = {2024}
}
备注
Accepted for publication at the 2024 International Conference on Space Robotics (iSpaRo)