用于航天器近距离机动与对接的深度贝叶斯强化学习
机器人学
2024-05-24 v2 人工智能
摘要
在追求航天器自主近距离机动与对接(PMD)的过程中,我们提出一种新颖的贝叶斯 actor-critic 强化学习算法,以学习具有稳定性保证的控制策略。PMD 任务被建模为反映相对动力学模型、对接锥与代价函数的马尔可夫决策过程。基于李雅普诺夫理论原理,我们将时序差分学习构建为约束高斯过程回归问题。这一创新方法利用高斯过程与深度核学习,将状态值函数表示为李雅普诺夫函数。我们开发了一种新颖的贝叶斯求积策略优化流程,在解析计算策略梯度的同时集成基于李雅普诺夫的稳定性约束。该集成对于满足航天任务严格的安全性需求至关重要。所提算法已在航天器气浮试验台上进行实验评估,并展现出令人印象深刻的、有前景的性能。
引用
@article{arxiv.2311.03680,
title = {Deep Bayesian Reinforcement Learning for Spacecraft Proximity Maneuvers and Docking},
author = {Desong Du and Naiming Qi and Yanfang Liu and Wei Pan},
journal= {arXiv preprint arXiv:2311.03680},
year = {2024}
}
备注
Because of a conflict of interest between me and my author's institution, my author and I do not want this paper to continue publication