中文

基于 TLE 的 A2C 景观轨道规划智能体

机器人学 2025-08-15 v1 人工智能

摘要

地球轨道 (LEO) 的日益拥堵为卫星的高效部署与安全运营带来持续挑战。任务规划师必须不仅考虑任务特定要求,还要考虑与活跃卫星及太空碎片之间的增加碰撞风险。本文提出一种基于优势演员-评论家 (A2C) 算法的强化学习框架,用于优化卫星轨道参数,以实现预定义表面半径范围内的精确地面覆盖。通过在自定义的 OpenAI Gymnasium 环境中将问题形式化为马尔可夫决策过程 (MDP),本方法使用经典 Kepler 元素模拟轨道动力学。该智能体逐步学习调整五个轨道参数——半长轴、离心率、倾角、升交点经向角以及近地点偏角——以实现目标地面覆盖。与受限策略优化 (PPO) 的比较评估显示,A2C 取得更佳性能,累积奖励提高 5.8 倍(10.0 与 9.263025),收敛所需时间缩短 31.5 倍(2,000 与 63,000)。A2C 智能体在 diverse 目标坐标下始终满足任务目标,同时保持适用于实时任务规划的计算效率。我们的工作贡献包括:(1) 集成物理约束的 TLE 轨道仿真环境,(2) 验证演员-评论家方法在连续轨道控制中优于信任区域方法,(3) 证明快速收敛性促进自适应卫星部署。该方法将强化学习建立为可扩展且高效的 LEO 任务规划替代方案。

关键词

引用

@article{arxiv.2508.10872,
  title  = {TLE-Based A2C Agent for Terrestrial Coverage Orbital Path Planning},
  author = {Anantha Narayanan and Battu Bhanu Teja and Pruthwik Mishra},
  journal= {arXiv preprint arXiv:2508.10872},
  year   = {2025}
}

备注

8 pages, 6 figures, 5 tables