评估基于学习的主动碎片清除任务规划中的鲁棒性与适应性
人工智能
2026-02-06 v1 机器学习
机器人学
空间物理
摘要
主动碎片清除(ADR)的自主任务规划必须在效率、适应性以及对燃料和任务持续时间的严格可行性约束之间进行权衡。本工作比较了三种针对低 Earth 轨道(LEO)中受限的多碎片 rendezvous 问题的规划器:一种在固定任务参数下训练的正式 Masked Proximal Policy Optimization(PPO)策略,一种在不同任务约束下进行域随机化训练以提高鲁棒性的域随机化 PPO 策略,以及一种纯粹的蒙特卡洛树搜索(MCTS)基线。评估在高保真轨道仿真中进行,包括加油、真实的传递动力学和随机化碎片场,覆盖 300 个测试案例,涵盖正式、减少燃料和减少任务时间场景。结果表明,正式 PPO 在条件匹配训练时实现最佳性能,但在分布迁移下性能急剧下降,而域随机化 PPO 在适应性方面表现更好,仅在正式性能上有适度的损失。MCTS 在处理约束变化方面始终最佳,由于在线重新规划,但计算时间高出数个数量级。这些发现凸显了学习型策略速度与搜索型方法适应性之间的权衡,表明结合训练时的多样性和在线规划是未来韧性 ADR 任务规划器的有前景的路径。
引用
@article{arxiv.2602.05091,
title = {Evaluating Robustness and Adaptability in Learning-Based Mission Planning for Active Debris Removal},
author = {Agni Bandyopadhyay and Günther Waxenegger-Wilfing},
journal= {arXiv preprint arXiv:2602.05091},
year = {2026}
}
备注
Presented at Conference: International Conference on Space Robotics (ISPARO,2025) At: Sendai,Japan