中文

探究强化学习中的稳定性边缘现象

机器学习 2023-07-11 v1

摘要

随着监督学习中稳定性边缘现象的揭示,人们在理解带动量全批量梯度下降训练的神经网络优化动态方面取得了进展。稳定性边缘现象发生于Hessian矩阵的主导特征值达到底层优化算法在二次损失下的发散阈值,此后它开始围绕该阈值振荡,损失呈现局部不稳定性但在长时间尺度上下降。本工作中,我们探索强化学习(RL)中的稳定性边缘现象,具体针对从离线到在线RL多种数据体制下的离策略Q-learning算法。我们的实验表明,尽管与监督学习存在显著差异(如数据分布的非平稳性和自举的使用),离策略深度RL中仍可能出现稳定性边缘现象。然而与监督学习不同,我们观察到其强烈依赖于底层损失:使用Huber损失的DQN表现出强烈的稳定性边缘效应,而使用交叉熵损失的C51中我们未观察到该效应。我们的结果表明,虽然神经网络结构可导致跨问题领域的优化动态迁移,深度RL优化的某些方面仍使其区别于监督学习等领域。

关键词

引用

@article{arxiv.2307.04210,
  title  = {Investigating the Edge of Stability Phenomenon in Reinforcement Learning},
  author = {Rares Iordan and Marc Peter Deisenroth and Mihaela Rosca},
  journal= {arXiv preprint arXiv:2307.04210},
  year   = {2023}
}