中文

对表示层令人惊讶地简单的正则化即可提升深度强化学习

机器学习 2023-04-25 v2 人工智能

摘要

深度强化学习(DRL)有望使智能体从高维信息中学习到优良策略,而表示学习可去除无关与冗余信息并保留相关信息。本文中,我们论证在理论上,QQ 网络及其目标 QQ 网络的所学表示应满足一种良好的可区分表示性质。具体而言,在典型 DRL 设定中,两个相邻时间步的值函数表示相似度存在上界。然而,通过示例实验,我们表明所学 DRL 智能体可能违背该性质并导致次优策略。因此,我们提出一种简单而有效的正则化器,称为表示层简易正则化策略评估(PEER),其通过对内部表示进行显式正则化来维持可区分表示性质。并且我们给出了 PEER 的收敛速率保证。实现 PEER 仅需一行代码。我们的实验表明,将 PEER 融入 DRL 可显著提升性能与样本效率。综合实验显示,PEER 在 PyBullet 的全部 4 个环境、DMControl 的 12 项任务中的 9 项、以及 Atari 的 26 个游戏中的 19 个上达到了最先进(state-of-the-art)性能。据我们所知,PEER 是首个研究 Q 网络及其目标固有表示性质的工作。我们的代码见 https://sites.google.com/view/peer-cvpr2023/。

关键词

引用

@article{arxiv.2205.14557,
  title  = {Frustratingly Easy Regularization on Representation Can Boost Deep Reinforcement Learning},
  author = {Qiang He and Huangyuan Su and Jieyu Zhang and Xinwen Hou},
  journal= {arXiv preprint arXiv:2205.14557},
  year   = {2023}
}

备注

Accepted to CVPR23. Website: https://sites.google.com/view/peer-cvpr2023/