中文

利用局部向导增强强化学习智能体

机器学习 2024-07-16 v1 系统与控制 系统与控制

摘要

本文解决了将局部向导策略集成到强化学习智能体中的问题。为此,我们展示了如何调整现有算法以适应此设置,随后引入了一种基于噪声策略切换过程的新算法。该方法建立在适当的近似策略评估 (APE) 方案之上,提供一种扰动,谨慎地引导局部向导走向更好的动作。我们在一系列经典强化学习问题上评估了我们的方法,包括安全关键系统,其中智能体不能进入某些区域以免触发灾难性后果。在所有提出的环境中,我们的智能体证明能够有效利用这些策略来提升任何基于 APE 的强化学习算法的性能,尤其是在其学习的初始阶段。

关键词

引用

@article{arxiv.2402.13930,
  title  = {Enhancing Reinforcement Learning Agents with Local Guides},
  author = {Paul Daoudi and Bogdan Robu and Christophe Prieur and Ludovic Dos Santos and Merwan Barlier},
  journal= {arXiv preprint arXiv:2402.13930},
  year   = {2024}
}