中文

正则化在策略镜像梯度中的作用

机器学习 2025-07-14 v1

摘要

策略镜像梯度(Policy Mirror Descent, PMD)已在强化学习(RL)中成为一种统一框架,因其将策略梯度方法与一种称为镜像梯度的的一阶优化方法相联系。PMD 的核心在于包含两种关键正则化组件:(i)距离项用于稳健的策略更新,形成信任区域;(ii)马尔可夫决策过程(MDP)正则化器用于增强奖励函数,以促进结构和鲁棒性。尽管 PMD 在理论上已得到广泛研究,但实际实验调查仍寥寥。本文对这两种正则化技术之间的相互作用进行大规模实证分析,在小型 RL 环境中运行了超过 50 万次训练种子。我们的结果表明,尽管两种正则化器可以部分互相替代,但其精确的组合对于实现稳健性能至关重要。这些发现凸显了在 RL 中开发更鲁棒算法的潜力,尤其是关于超参数敏感性的研究。

关键词

引用

@article{arxiv.2507.08718,
  title  = {On the Effect of Regularization in Policy Mirror Descent},
  author = {Jan Felix Kleuker and Aske Plaat and Thomas Moerland},
  journal= {arXiv preprint arXiv:2507.08718},
  year   = {2025}
}

备注

Accepted at RLC