策略震荡现象
机器学习
2022-10-24 v3 人工智能
机器学习
摘要
我们识别并研究了策略震荡现象,即基于价值的强化学习中贪婪策略的快速变化。策略震荡以惊人的速度运作,在少量学习更新内就改变了大量状态中的贪婪动作(在典型的深度RL设置如Atari上的DQN中)。我们从经验上刻画了该现象,证实其不限于特定的算法或环境性质。若干消融实验将震荡发生的貌似合理的解释缩减到少数几种,均与深度学习相关。最后,我们假设策略震荡是一种有益却被忽视的隐式探索形式,它以新的视角看待 -贪婪探索,即 -噪声的作用远比预期的小。
引用
@article{arxiv.2206.00730,
title = {The Phenomenon of Policy Churn},
author = {Tom Schaul and André Barreto and John Quan and Georg Ostrovski},
journal= {arXiv preprint arXiv:2206.00730},
year = {2022}
}
备注
Published at NeurIPS 2022