中文

DQN 中的泛化与正则化

机器学习 2020-01-22 v3 人工智能 机器学习

摘要

深度强化学习算法已展现出在高维任务中学习复杂控制策略的惊人能力。然而,尽管在流行基准上的性能不断提升,深度强化学习算法学到的策略在评估于极为相似的环境中时可能难以泛化。本文中我们提出一种通过 Atari 2600 游戏的不同模式评估强化学习泛化的协议。利用该协议我们评估了最传统的深度强化学习算法之一 DQN 的泛化能力,并提供证据表明 DQN 对训练环境过度专门化。随后我们全面评估了 dropout 与 2\ell_2 正则化的影响,以及复用所学表示以提升 DQN 泛化能力的影响。尽管正则化在深度强化学习中大体未被充分利用,我们展示其实际上可帮助 DQN 学习更具通用性的特征。这些特征可在相似任务上复用并微调,显著改善 DQN 的样本效率。

关键词

引用

@article{arxiv.1810.00123,
  title  = {Generalization and Regularization in DQN},
  author = {Jesse Farebrother and Marlos C. Machado and Michael Bowling},
  journal= {arXiv preprint arXiv:1810.00123},
  year   = {2020}
}

备注

Earlier versions of this work were presented both at the NeurIPS'18 Deep Reinforcement Learning Workshop and the 4th Multidisciplinary Conference on Reinforcement Learning and Decision Making (RLDM'19)