借助谱归一化实现更深层的深度强化学习
机器学习
2022-01-05 v4
摘要
在计算机视觉与自然语言处理中,增加模型容量的模型架构创新已可靠地转化为性能提升。与这一趋势形成鲜明对比的是,最先进的强化学习(RL)算法常使用小型MLP,性能提升通常源于算法创新。很自然地会假设RL中的小数据集需要简单模型以避免过拟合;然而,该假设未经检验。本文中,我们研究用具有跳跃连接与归一化的大型现代网络替换小型MLP对RL智能体的影响,特别关注行动者-评论家算法。我们经实证验证,朴素地采用此类架构会导致不稳定与糟糕性能,这很可能是实践中简单模型流行的原因。然而,我们表明数据集规模并非限制因素,反而认为经由评论家反向传播梯度所引发的不稳定性才是罪魁祸首。我们证明谱归一化(SN)可缓解此问题并实现大型现代架构的稳定训练。经SN平滑后,更大模型带来显著的性能改进——这表明除算法创新外,聚焦于模型架构或可获得更多“轻易”的收益。
引用
@article{arxiv.2106.01151,
title = {Towards Deeper Deep Reinforcement Learning with Spectral Normalization},
author = {Johan Bjorck and Carla P. Gomes and Kilian Q. Weinberger},
journal= {arXiv preprint arXiv:2106.01151},
year = {2022}
}
备注
accepted NeurIPS 2021