深度强化学习的谱归一化:一种优化视角
机器学习
2021-05-12 v1 人工智能
摘要
近来大多数深度强化学习的进展都采取以强化学习为中心的视角,聚焦于训练目标的改进。我们偏离这一看法,表明无需改变目标,而通过对值函数估计器进行正则化即可恢复这些进展的性能。使用谱归一化约束单层的Lipschitz常数,就足以在具有挑战性的Atari领域将Categorical-DQN智能体的性能提升至更为精细的\rainbow{}智能体的水平。我们进行消融实验以分离归一化对学习动力学的各种影响,并表明仅调节参数更新就足以恢复谱归一化的绝大部分性能。这些发现暗示,要解决深度强化学习的特殊性,也需要关注神经组件及其学习动力学。
引用
@article{arxiv.2105.05246,
title = {Spectral Normalisation for Deep Reinforcement Learning: an Optimisation Perspective},
author = {Florin Gogianu and Tudor Berariu and Mihaela Rosca and Claudia Clopath and Lucian Busoniu and Razvan Pascanu},
journal= {arXiv preprint arXiv:2105.05246},
year = {2021}
}
备注
Accepted at ICML2021