中文

基于 Transformer 的强化学习用于部分可观测环境下自主轨道碰撞规避

机器学习 2026-03-26 v1 人工智能

摘要

我们引入了一个基于 Transformer 的强化学习框架,用于自主轨道碰撞规避,显式建模了空间操作中部分可观测性和不完美监控的影响。该框架结合了可配置的 encounter 模拟器、距离依赖的观察模型和顺序状态估计器,以表示相对运动的不确定性。本工作的核心贡献之一是使用基于 Transformer 的部分可观测马尔可夫决策过程(POMDP)架构,利用长程时间注意力更有效地解释噪声和间歇性观察,优于传统架构。该集成为在不完美监控环境下运行的碰撞规避智能体提供了基础。

关键词

引用

@article{arxiv.2602.06088,
  title  = {Transformer-Based Reinforcement Learning for Autonomous Orbital Collision Avoidance in Partially Observable Environments},
  author = {Thomas Georges and Adam Abdin},
  journal= {arXiv preprint arXiv:2602.06088},
  year   = {2026}
}