中文

深度强化学习的谱归一化:一种优化视角

机器学习 2021-05-12 v1 人工智能

摘要

近来大多数深度强化学习的进展都采取以强化学习为中心的视角,聚焦于训练目标的改进。我们偏离这一看法,表明无需改变目标,而通过对值函数估计器进行正则化即可恢复这些进展的性能。使用谱归一化约束单层的Lipschitz常数,就足以在具有挑战性的Atari领域将Categorical-DQN智能体的性能提升至更为精细的\rainbow{}智能体的水平。我们进行消融实验以分离归一化对学习动力学的各种影响,并表明仅调节参数更新就足以恢复谱归一化的绝大部分性能。这些发现暗示,要解决深度强化学习的特殊性,也需要关注神经组件及其学习动力学。

关键词

引用

@article{arxiv.2105.05246,
  title  = {Spectral Normalisation for Deep Reinforcement Learning: an Optimisation Perspective},
  author = {Florin Gogianu and Tudor Berariu and Mihaela Rosca and Claudia Clopath and Lucian Busoniu and Razvan Pascanu},
  journal= {arXiv preprint arXiv:2105.05246},
  year   = {2021}
}

备注

Accepted at ICML2021