中文

排除无关项:通过连续动作掩码聚焦强化学习

机器学习 2024-11-06 v2 系统与控制 系统与控制

摘要

在强化学习(RL)中,连续动作空间通常被定义为多维区间。虽然区间通常能很好地反映任务的动作边界,但由于全球动作空间通常较大,导致频繁探索无关动作,这在学习过程中具有挑战。然而,少量任务知识即可足以识别显著较小的、与状态相关的相关动作集合。将学习聚焦于这些相关动作可显著提高训练效率和效果。本文提出聚焦于相关动作集合的学习方法,引入三种连续动作掩码,以精确将动作空间映射到状态依赖的相关动作集合。因此,我们的方法确保仅执行相关动作,增强了RL代理的可预测性,使其可用于安全关键型应用。我们进一步推导了所提方法对策略梯度的影响。使用近端策略优化(PPO),我们在四个控制任务上进行评估,其中相关动作集合基于系统动力学和相关状态集合计算得出。我们的实验表明,三种动作掩码方法在不使用动作掩码的基线之外,获得更高的最终奖励并更快地收敛。

关键词

引用

@article{arxiv.2406.03704,
  title  = {Excluding the Irrelevant: Focusing Reinforcement Learning through Continuous Action Masking},
  author = {Roland Stolz and Hanna Krasowski and Jakob Thumm and Michael Eichelbeck and Philipp Gassert and Matthias Althoff},
  journal= {arXiv preprint arXiv:2406.03704},
  year   = {2024}
}