中文

基于潜在空间目标的最优控制实现深度强化学习行为模式切换

机器学习 2024-06-05 v1 系统与控制 系统与控制

摘要

在这项工作中,我们使用最优控制,通过在策略的潜在空间中直接优化来改变深度强化学习策略的行为。我们假设,在深度强化学习策略潜在空间的某些区域内可以识别出不同的行为模式,这意味着在这些区域内偏好特定的动作或策略。我们使用基于 PACMAP 的潜在空间降维来识别这些行为模式。利用最优控制过程生成的动作,我们将系统从一种行为模式转移到另一种。随后,我们利用这些动作作为解释神经网络策略的过滤器。结果表明,这种方法可以在策略中施加期望的行为模式,通过展示如何使用月球着陆器强化学习环境使失败的回合变得成功,反之亦然。

关键词

引用

@article{arxiv.2406.01178,
  title  = {Deep Reinforcement Learning Behavioral Mode Switching Using Optimal Control Based on a Latent Space Objective},
  author = {Sindre Benjamin Remman and Bjørn Andreas Kristiansen and Anastasios M. Lekkas},
  journal= {arXiv preprint arXiv:2406.01178},
  year   = {2024}
}

备注

Published in the proceedings of the 32nd Mediterranean Conference on Control and Automation [MED2024]