中文

基于 Transformer 强化学习的多相位航天器轨迹优化

机器学习 2025-11-17 v1

摘要

航天器控制中的自主化操作,如发射、升空、分离阶段和轨道插入,仍是关键挑战,因需适应不同动态 regime 的政策以实现泛化。虽然强化学习 (RL) 在单个天体力学任务中显示出前景,但现有方法往往需要为不同任务阶段分别设计政策,限制了可适应性并增加了操作复杂度。本文引入一种基于 Transformer 的 RL 框架,通过单一政策架构统一多相位轨迹优化,利用 Transformer 固有的建模长时序语境能力。基于近端策略优化 (PPO),我们的框架将常规循环网络替换为 Transformer 编码器-解码器结构,使智能体能够在关键操作持续数秒至数分钟的任务阶段之间保持连贯记忆。通过集成 Gated Transformer-XL (GTrXL) 架构,框架在无需人工 phase 转换的情况下维持控制决策的稳定性。我们逐步验证了该方法:首先在单相位基准问题(双积分器和范德波尔振荡器)上展示接近最优性能,随后扩展到多相位 waypoint navigation 变体,最终针对包含大气飞行、分离阶段和真空作业的复杂多相位火箭升空问题进行测试。结果表明,基于 Transformer 的框架不仅在简单情形中匹配分析解,还能在动态差异大的 regime 之间有效学习连贯的控制政策,为可扩展的自主任务计划奠定了基础,减少了基于相位的控制器依赖,同时保持与安全关键验证协议的兼容性。

关键词

引用

@article{arxiv.2511.11402,
  title  = {Multi-Phase Spacecraft Trajectory Optimization via Transformer-Based Reinforcement Learning},
  author = {Amit Jain and Victor Rodriguez-Fernandez and Richard Linares},
  journal= {arXiv preprint arXiv:2511.11402},
  year   = {2025}
}