理解与预防强化学习中的容量损失
机器学习
2022-05-05 v2
摘要
强化学习(RL)问题充斥着非平稳性的来源,使其成为神经网络应用领域中出了名的困难问题。我们识别了一种机制, whereby 非平稳预测目标会阻碍深度 RL 智能体的学习进展:容量损失(capacity loss),即网络在一系列目标值上训练后,随时间失去快速更新其预测的能力。我们证明了容量损失发生在一系列 RL 智能体和环境中,并且对稀疏奖励任务中的性能尤其具有破坏性。然后我们提出了一种简单的正则化器,初始特征正则化(InFeR),它通过将一个特征子空间回归至其初始化时的值来缓解这一现象,从而在 Montezuma's Revenge 等稀疏奖励环境中带来显著的性能提升。我们得出结论,预防容量损失对于使智能体能够最大化受益于其在整个训练轨迹中所获得的学习信号至关重要。
引用
@article{arxiv.2204.09560,
title = {Understanding and Preventing Capacity Loss in Reinforcement Learning},
author = {Clare Lyle and Mark Rowland and Will Dabney},
journal= {arXiv preprint arXiv:2204.09560},
year = {2022}
}
备注
Presented at ICLR 2022