走出阴影:阴影模式下的强化学习
机器学习
2024-11-01 v1
摘要
强化学习 (RL) 在许多信息物理系统(如机器人、过程自动化和电力系统)中尚不具备竞争力,因为无法加速在含物理组件的系统上的训练,且仿真模型要么不存在,要么存在巨大的仿真与现实差距。在漫长的训练期间,昂贵的设备无法使用,甚至可能因强化学习智能体的不当动作而损坏。我们的新方法正是解决这一问题:我们在所谓的阴影模式下,借助一个现有的、无需训练且能即时表现良好的常规控制器来训练强化学习智能体。在阴影模式下,智能体依赖控制器提供动作样本和朝向有利状态的引导来学习任务,同时估计在哪些状态下学习到的智能体将获得比常规控制器更高的奖励。然后,RL 智能体将在这些状态下控制系统,而所有其他区域仍由现有控制器控制。随着时间的推移,RL 智能体将接管越来越多的状态,同时在其无法超越基线性能的区域将控制权交还给基线控制器。因此,我们在训练期间保持低遗憾,并相较于仅使用常规控制器或强化学习提高了性能。我们提出并评估了两种用于决定是使用 RL 智能体还是常规控制器的机制。我们的方法在一个可达-避障任务中展示了其实用性,在该任务中,我们能够有效训练一个智能体,而标准方法则失败了。
引用
@article{arxiv.2410.23419,
title = {Stepping Out of the Shadows: Reinforcement Learning in Shadow Mode},
author = {Philipp Gassert and Matthias Althoff},
journal= {arXiv preprint arXiv:2410.23419},
year = {2024}
}