表示秩的自适应正则化作为Bellman方程的隐式约束
机器学习
2024-04-22 v1 人工智能
摘要
表示秩是理解神经网络(NN)在深度强化学习(DRL)中作用的一个重要概念,用于衡量价值网络的表达能力。现有研究侧重于无限制地最大化该秩;然而,这种方法会在学习过程中引入过于复杂的模型,从而损害性能。因此,微调表示秩是一个具有挑战性且至关重要的优化问题。为了解决这个问题,我们找到了一个自适应控制表示秩的指导原则。我们以Bellman方程为理论基础,推导出价值网络中连续状态-动作对表示的余弦相似度上限。然后,我们利用该上限提出了一种新颖的正则化项,即基于Bellman方程的自动秩正则化器(BEER)。该正则化器自适应地正则化表示秩,从而提高DRL智能体的性能。我们首先在说明性实验中验证了秩自动控制的有效性。然后,通过将其与确定性策略梯度方法相结合,我们将BEER扩展到复杂的连续控制任务中。在12个具有挑战性的DeepMind控制任务中,BEER大幅优于基线方法。此外,BEER在Q值近似方面展现出显著优势。我们的代码可在 https://github.com/sweetice/BEER-ICLR2024 获取。
引用
@article{arxiv.2404.12754,
title = {Adaptive Regularization of Representation Rank as an Implicit Constraint of Bellman Equation},
author = {Qiang He and Tianyi Zhou and Meng Fang and Setareh Maghsudi},
journal= {arXiv preprint arXiv:2404.12754},
year = {2024}
}
备注
Accepted to CVPR23; Code: https://github.com/sweetice/BEER-ICLR2024