中文

时序差分动力学的特征子空间及其如何改进强化学习中的价值近似

机器学习 2023-11-09 v2 人工智能 系统与控制 系统与控制

摘要

我们提出了一种新颖的价值近似方法,即特征子空间正则化评论家(Eigensubspace Regularized Critic, ERC),用于深度强化学习(RL)。ERC 的动机源于对时序差分(Temporal-Difference, TD)方法中 Q 值近似误差动力学的分析,该误差沿着由与马尔可夫决策过程(Markov Decision Process, MDP)相关的转移核的 1-特征子空间所定义的路径演化。这揭示了 TD 学习的一个基本性质,而以往的深度学习 RL 方法尚未利用该性质。在 ERC 中,我们提出一种正则化项,引导近似误差趋向于 1-特征子空间,从而实现更高效且稳定的价值近似路径。此外,我们从理论上证明了 ERC 方法的收敛性。理论与实验还表明,ERC 有效降低了价值函数的方差。在 DMControl 基准的 26 个任务中,ERC 在 20 个上优于最先进的方法。此外,它在 Q 值近似和方差缩减方面表现出显著优势。我们的代码可在 https://sites.google.com/view/erc-ecml23/ 获取。

关键词

引用

@article{arxiv.2306.16750,
  title  = {Eigensubspace of Temporal-Difference Dynamics and How It Improves Value Approximation in Reinforcement Learning},
  author = {Qiang He and Tianyi Zhou and Meng Fang and Setareh Maghsudi},
  journal= {arXiv preprint arXiv:2306.16750},
  year   = {2023}
}

备注

Accepted to ECML23. Code: https://sites.google.com/view/erc-ecml23/