中文

面向复杂航天器任务的受保护深度强化学习

机器学习 2024-03-15 v3

摘要

基于受保护深度强化学习 (SDRL) 的自主航天器控制已成为一个快速发展的研究领域。然而,保护机制的构建和任务的定义仍然是非形式化的,导致策略无法保证安全性,且强化学习智能体的目标模糊。在本文中,我们首先探索使用形式化语言,即线性时序逻辑 (LTL),来形式化航天器任务和安全要求。然后,我们定义了一种方法,用于从 co-safe LTL 规范自动构建奖励函数,以便在 SDRL 框架中进行有效训练。我们还研究了针对航天器应用从安全 LTL 规范构建保护机制的方法,并提出了三种提供概率保证的设计。我们通过几个实验展示了这些保护机制如何与不同策略交互,以及奖励结构的灵活性。

关键词

引用

@article{arxiv.2403.05693,
  title  = {Shielded Deep Reinforcement Learning for Complex Spacecraft Tasking},
  author = {Robert Reed and Hanspeter Schaub and Morteza Lahijanian},
  journal= {arXiv preprint arXiv:2403.05693},
  year   = {2024}
}

备注

9 pages, 2 figures, 2 tables, ACC 2024