中文

DR3:基于价值的深度强化学习需要显式正则化

机器学习 2021-12-10 v1

摘要

尽管存在过度参数化,通过监督学习训练的深度网络易于优化并展现出优异的泛化能力。一种解释此现象的假设是,过度参数化的深度网络受益于随机梯度下降所诱导的隐式正则化效应,该效应倾向于产生在测试输入上泛化良好的简约解。我们有理由推测,深度强化学习(RL)方法也能从这种效应中受益。在本文中,我们讨论了在离线深度强化学习设置中,监督学习中观察到的 SGD 隐式正则化效应实际上可能是有害的,会导致泛化能力差和退化的特征表示。我们的理论分析表明,当现有的隐式正则化模型应用于时间差分学习时,所推导出的正则化项倾向于产生具有过度“混叠”的退化解,这与监督学习的情况形成鲜明对比。我们通过实验证实了这些发现,表明通过自举法训练的深度网络价值函数所学习的特征表示确实可能退化,对出现在贝尔曼备份两侧的状态-动作对产生混叠表示。为了解决这个问题,我们推导了这种隐式正则化项的形式,并受此推导启发,提出了一种简单有效的显式正则化器,称为 DR3,以抵消这种隐式正则化器的不良影响。当与现有的离线强化学习方法结合时,DR3 显著提高了性能和稳定性,缓解了在 Atari 2600 游戏、D4RL 领域和基于图像的机器人操作中的遗忘问题。

关键词

引用

@article{arxiv.2112.04716,
  title  = {DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization},
  author = {Aviral Kumar and Rishabh Agarwal and Tengyu Ma and Aaron Courville and George Tucker and Sergey Levine},
  journal= {arXiv preprint arXiv:2112.04716},
  year   = {2021}
}