基于 Transformer 的强化学习用于部分可观测环境下自主轨道碰撞规避
机器学习
2026-03-26 v1 人工智能
摘要
我们引入了一个基于 Transformer 的强化学习框架,用于自主轨道碰撞规避,显式建模了空间操作中部分可观测性和不完美监控的影响。该框架结合了可配置的 encounter 模拟器、距离依赖的观察模型和顺序状态估计器,以表示相对运动的不确定性。本工作的核心贡献之一是使用基于 Transformer 的部分可观测马尔可夫决策过程(POMDP)架构,利用长程时间注意力更有效地解释噪声和间歇性观察,优于传统架构。该集成为在不完美监控环境下运行的碰撞规避智能体提供了基础。
引用
@article{arxiv.2602.06088,
title = {Transformer-Based Reinforcement Learning for Autonomous Orbital Collision Avoidance in Partially Observable Environments},
author = {Thomas Georges and Adam Abdin},
journal= {arXiv preprint arXiv:2602.06088},
year = {2026}
}