中文

策略震荡现象

机器学习 2022-10-24 v3 人工智能 机器学习

摘要

我们识别并研究了策略震荡现象,即基于价值的强化学习中贪婪策略的快速变化。策略震荡以惊人的速度运作,在少量学习更新内就改变了大量状态中的贪婪动作(在典型的深度RL设置如Atari上的DQN中)。我们从经验上刻画了该现象,证实其不限于特定的算法或环境性质。若干消融实验将震荡发生的貌似合理的解释缩减到少数几种,均与深度学习相关。最后,我们假设策略震荡是一种有益却被忽视的隐式探索形式,它以新的视角看待 ϵ\epsilon-贪婪探索,即 ϵ\epsilon-噪声的作用远比预期的小。

关键词

引用

@article{arxiv.2206.00730,
  title  = {The Phenomenon of Policy Churn},
  author = {Tom Schaul and André Barreto and John Quan and Georg Ostrovski},
  journal= {arXiv preprint arXiv:2206.00730},
  year   = {2022}
}

备注

Published at NeurIPS 2022