在无界状态空间中学习稳定化在线强化学习
机器学习
2024-05-28 v3
摘要
在许多强化学习(RL)应用中,我们需要策略能够到达期望状态,并在无限长的时间内将受控系统保持在期望状态周围可接受的区域之内。后一目标称为稳定性,当状态空间无界时尤为重要,因为此时状态之间可以任意远离,智能体可能漂移到远离期望状态的地方。例如,在随机排队网络中,等待任务的队列长度可以无界增长,期望状态是所有队列长度为零。这里,稳定策略保证队列长度有限,而最优策略最小化队列长度。由于最优策略也是稳定的,人们会期望RL算法隐式地给出稳定策略。然而,在这项工作中,我们发现,在在线训练期间直接最小化到期望状态距离的深层RL算法常常导致不稳定策略,即漂离期望状态的策略。我们将这种不稳定性归因于对导致失稳动作的信用分配不佳。随后,我们提出一种基于两个思路的方法:1)基于Lyapunov的代价塑形技术;2)对无界状态空间的状态变换。我们在多种排队网络与交通信号控制问题上进行了实证研究,发现我们的方法在与掌握转移动力学的强基线对比时表现具有竞争力。我们的代码可在此获取:https://github.com/Badger-RL/STOP。
引用
@article{arxiv.2306.01896,
title = {Learning to Stabilize Online Reinforcement Learning in Unbounded State Spaces},
author = {Brahma S. Pavse and Matthew Zurek and Yudong Chen and Qiaomin Xie and Josiah P. Hanna},
journal= {arXiv preprint arXiv:2306.01896},
year = {2024}
}
备注
Accepted to International Conference on Machine Learning (ICML) 2024